Tokenless vil skære din regning for AI-inferens med halvdelen automatisk
YC-opstart tilbyder en router, der sender forespørgsler til flere modeller og vælger den billigste, der klarer opgaven
De fleste opgaver man sender til en AI-model kræver ikke den dyreste frontier-model. Det er udgangspunktet for Tokenless, en ny tjeneste der fungerer som en router mellem din applikation og dine AI-modeller.
Når du sender en forespørsel gennem Tokenless, sendes den til flere modeller på én gang. Tjenesten overvejer hvilken model der er på rette vej, vælger den og annullerer de øvrige. Du betaler kun for den model der fuldfører opgaven.
Ifølge Tokenless kan det halvere ens inference-regning. Selskabet kalder sig »a drop-in replacement«, og lover at man kun behøver at ændre to linjer kode for at komme i gang. Endepunkterne er kompatible med både OpenAI og Anthropics API-format.
På deres hjemmeside nævner Tokenless resultater på benchmarks som τ³-Banking, Terminal-Bench 2.1 og DeepSWE 1.1, men der offentliggøres ingen konkrete tal i det materiale der er tilgængeligt.
Bag selskabet står forskere med baggrund i Google DeepMind, Princeton og UC Berkeley. Tokenless er en del af Y Combinators sommerhold 2026.
Det er uklart: Ingen konkrete besparelsestal eller benchmark-resultater er tilgængelige i kildematerialet. Besparelsen på »halvdelen« er selskabets eget markedsføringskrav, ikke verificerede tal.