Ökosystem

Jev kostet 4,2 Cent pro Million Token, und die Ausgabe ist gratis

3 Min. Lesezeit KI-generiert

Die Ja/Nein-Frage heißt bei TypeSafe Noul. Der Firmenchef hat auf Hacker News bestätigt, dass das für Bernoulli steht.

Featured image for "Jev kostet 4,2 Cent pro Million Token, und die Ausgabe ist gratis"

Simon Willison hat sich Jev eine Woche lang angesehen und beschreibt es als neue Form von Sprachmodell. TypeSafe AI nennt die Gattung System One Models; Willison hält, mit Maggie Appleton, Decision Models für den besseren Namen. Über die Vorstellung des Modells habe ich vergangene Woche geschrieben.

Der Unterschied steht in der Antwort. Jev nimmt Text entgegen und gibt keinen Text zurück, sondern Fließkommazahlen: Kategorien, Ja/Nein-Wahrscheinlichkeiten, Bewertungen, jeweils mit Konfidenz. TypeSafe selbst nennt es einen Funktionsaufruf mit Frontier-Intelligenz – unstrukturierter Zustand rein, getypte Entscheidung raus.

Ein Zustand, beliebig viele Fragen

Du baust ein Zustandsobjekt: ein String, eine Liste von Strings oder ein Satz Name-Wert-Paare. Das kann ein Artikel sein, ein Kunde, ein Datensatz. Dazu schickst du eine Frage oder hundert. Die Fragen laufen parallel, hundert dauern also etwa so lange wie eine.

Drei Fragetypen gibt es. Noul-Fragen sind Ja/Nein: Du stellst eine Behauptung auf und bekommst eine Zahl zwischen 0 und 1 zurück. Choice-Fragen lassen das Modell aus vorgegebenen Optionen wählen und liefern die Verteilung gleich mit. Score-Fragen geben eine beschriebene Skala vor und bekommen einen Punkt darauf.

Der Preis ist die zweite Besonderheit. Abgerechnet wird nur die Eingabe, die Ausgabe ist kostenlos, und die Eingabe kostet 0,042 Dollar je Million Token. Das ist billiger als GPT-5 Nano mit 0,05.

Wofür Willison es benutzt

Alles, was sich als Klassifikation formulieren lässt: Spam erkennen, Labels vorschlagen, Priorisieren, Sortieren. Sein interessantestes Beispiel ist die Neusortierung von Suchtreffern. Erst hundert Kandidaten mit einem billigen Verfahren wie BM25 holen, dann Jev jeden davon gegen die ursprüngliche Anfrage bewerten lassen.

Die Community hat in wenigen Tagen Absurderes gebaut. Kyle Penas jevchat macht aus Jev ein Chatmodell, indem es bei jedem Schritt eine einzige Frage stellt: Welches Zeichen kommt als Nächstes? Ein Kommentator auf Hacker News nannte es das digitale Äquivalent zu Morty, der mit dem Todeskristall spricht. Dazu kommen jev-leftpad von Fatih Kadir Akın und jev-2048 von Andy Gayton.

Eine Woche alt und schon nachgebaut

Parallel entstehen offene Nachbauten. Kev setzt auf Qwen 3.5 auf und kommt in Größen von 0,8, 4 und 9 Milliarden Parametern. Ein JevBench zum Vergleich von Modellen dieser Klasse existiert auch schon.

Für ein Modell, das seit knapp einer Woche draußen ist, ist das viel Betrieb – und ein brauchbarer Hinweis darauf, dass hier eine Lücke gefüllt wurde, die viele gespürt haben.

Die Blackbox wird noch schwärzer

Willisons Einwand ist der wichtigste Teil seines Textes. Ein Sprachmodell ist schon eine Blackbox, aber du kannst es wenigstens nach seiner Begründung fragen, auch wenn die Antwort nicht stimmen muss. Jev gibt dir eine Zahl. Wenn es etwas als Spam markiert, erfährst du nie, welches Signal den Ausschlag gab.

Bei Vorurteilen wird das ernst. Willison hofft ausdrücklich, dass niemand Jev auf Bewerbungen loslässt. Sein eigener Test: Er ließ jede Stadt der Bay Area auf die Frage «Gute Stadt?» bewerten. Cupertino ganz oben, East Palo Alto ganz unten.

Genau deshalb hängt bei Decision Models alles an Evaluierungen. Das ist die gute Nachricht an dem Preis: Wer tausend Testfragen durchlaufen lässt, zahlt ein paar Cent. Ein Werkzeug, dessen einziges Fenster nach innen der Test ist, sollte wenigstens billig genug sein, um oft getestet zu werden.

Quellen

ModelleEntwicklerJev