Zum Inhalt springen
Michael Seel
Zurück

Jev im Praxistest: Ein Modell für die kleinen Urteile

Abstraktes Titelbild zu Jev im Praxistest: Ein Modell für die kleinen Urteile
TL;DR

Jev von TypeSafe AI erzeugt keinen Text. Es bekommt einen Sachverhalt und typisierte Fragen und gibt pro Frage eine Wahrscheinlichkeit zurück. Ich habe drei Tage damit gemessen.

  • Gut für viele kleine Urteile mit kleinem Schadensradius: Telemetrie deuten, Tickets vorsortieren, Mails zuordnen, als Gate vor dem teuren Modell. 758 Anfragen haben mich 3 Cent gekostet, eine Antwort dauert aus Deutschland 260 Millisekunden, und vierzig Fragen zu einem Vorgang kosten kaum mehr als eine.
  • Bei der Urteilsqualität liegt es auf gleichem Antwortformat vorn oder gleichauf mit drei günstigen Sprachmodellen, in der Kalibrierung dahinter. Drei Grenzen: Was das Schema nicht vorsieht, verschwindet geräuschlos. Sachfremde Angaben im Vorgang verschieben das Urteil. Und die Zahl kommt ohne einen Satz dazu, warum.
  • Ein neues Werkzeug, über das ich mich freue. Es ergänzt Sprachmodelle am unteren Ende und ersetzt sie nirgends, wo Text oder eine Begründung gebraucht wird.

Jev erzeugt keinen Text. Es bekommt einen Sachverhalt, also eine Mail, ein Log oder einen ganzen Vorgang mit Anhängen, dazu typisierte Fragen: Ist diese Aussage wahr, welche dieser Optionen trifft zu, wo auf dieser Skala liegt der Fall. Zurück kommt pro Frage ein Wert mit Wahrscheinlichkeit. Kein Satz dazu, nichts zum Parsen.

TypeSafe AI nennt die Gattung System-One-Modell und verspricht vier Dinge: schneller als ein Sprachmodell, billiger, keine Halluzinationen, echte Wahrscheinlichkeiten.1 Ich habe seit ein paar Tagen Vorabzugang und drei Tage lang nachgemessen, gegen Jev selbst und gegen drei günstige Sprachmodelle auf denselben Fällen.2 Zwei halten, zwei nur halb. Die interessantere Frage ist ohnehin, wofür man so ein Modell nimmt und wofür nicht.

Kein Sprachmodell mit Schema

Ein Sprachmodell mit JSON-Schema liefert auf den ersten Blick dasselbe. Es schreibt Wort für Wort einen Text, der am Ende ins Schema passt. Will ich von ihm eine Wahrscheinlichkeit, muss ich es bitten, eine Zahl zu schreiben, und ihm vorher erklären, was 70 Prozent bedeuten sollen. Bei Jev ist die Verteilung über den Wertebereich das Ergebnis selbst. Die Zahl kommt umsonst, und die Form stimmt immer.

Ob die Zahl auch gut ist, steht auf einem anderen Blatt. In meinem Testsatz waren alle drei Sprachmodelle auf den entscheidbaren Fällen besser kalibriert als Jev, GLM 5.3 Flash am deutlichsten.3 Wie gut die Zahl zur eigenen Wirklichkeit passt, muss man auf eigenen Daten nachmessen, bei jedem Modell.

Sortieren für drei Cent

Die 758 Jev-Anfragen für Vergleich und Kontaminationstest, zusammen 734.000 Eingabe-Token, haben 3 Cent gekostet. Gegen GLM 5.3 Flash, das günstigste Sprachmodell im Vergleich, ist das Faktor 3.

Beim Tempo verspricht TypeSafe 70 bis 500 Millisekunden.1 Über eine offengehaltene Verbindung antwortet Jev aus Deutschland in 260 Millisekunden im Median. Davon sind rund 160 der Weg nach Oregon und zurück, die Bearbeitung selbst meldet der Server mit 80 Millisekunden. GPT-5.6 Luna über die schnellste Route und GLM 5.3 Flash lagen in denselben Minuten zwischen 500 und 1.100 Millisekunden.2 Das Versprechen hält.

Interessanter als der Preis pro Anfrage ist, wie er zustande kommt.

NOTE

Vierzig Fragen kosten 3,1 Prozent mehr als eine.

Derselbe Sachverhalt von rund 26.000 Token, etwa fünfzehn Seiten, einmal mit einer und einmal mit vierzig Fragen. Der Sachverhalt wird pro Anfrage einmal abgerechnet, nicht pro Frage. Dieselben vierzig Fragen einzeln abzusetzen kostet das 38-fache.

Das ändert, wie man ein Feature schneidet. Man stellt an einer Stelle alle Fragen, die man zu einem Vorgang hat, und bekommt für jede eine Zahl. Bündeln kann ein Sprachmodell auch, nur zahlt man dort jede erzeugte Antwort mit.

Wofür ich das nehmen würde: Sensordaten und Telemetrie deuten, also ist dieses Muster auffällig, ist dieser Log-Eintrag neu oder bekannt. Vorsortieren statt entscheiden, ein Ticket in eine Warteschlange legen, eine Mail einer Abteilung zuordnen, beides reversibel, solange der Fehler rechtzeitig auffällt. Oder als Gate vor dem teuren Modell: Braucht dieser Fall überhaupt ein Sprachmodell? Wobei ein Gate, das den falschen Fall abweist, nicht mehr folgenarm ist.

Drei Kriterien, und alle drei müssen gelten. Die Entscheidung ist folgenarm, sie ist billig zu korrigieren, und sie hängt nicht allein an einem unbegründeten Modellurteil. Das trifft auf erstaunlich viel zu, nämlich auf all die Fälle, für die ich heute ein Sprachmodell rufe, obwohl ich keine Prosa brauche.

Dahinter beginnen drei Grenzen.

Was das Schema nicht vorsieht, verschwindet

TypeSafe wirbt mit null Halluzinationen. Das stimmt in einem engen Sinn: Es entsteht kein Text, also kann keiner erfunden werden, und die Antwort passt immer ins Schema. TypeSafe räumt selbst ein, dass die Null aus dieser Garantie folgt und nicht gemessen wurde.1 Fachlich falsch kann die Zahl weiterhin sein.

Wie oft, habe ich an 120 Fällen mit bekannter Antwort gemessen, gegen drei günstige Sprachmodelle. 80 Fälle lassen sich aus dem Sachverhalt entscheiden, bei 40 schweigt er. Alle vier bekommen dieselbe Auswahlfrage mit drei Optionen: ja, nein, steht nicht da. Bei den 80 zählt das richtige Urteil, eine Enthaltung zählt als Fehler. Bei den 40 zählt, ob das Modell “steht nicht da” wählt.

Richtig bei 80 entscheidbarenFehlende Information erkanntGesamt
Jev5040 von 4075,0 %
GLM 5.3 Flash4939 von 4073,3 %
Gemini 3.8 Flash4140 von 4067,5 %
GPT-5.6 Luna3940 von 4065,8 %

Fehlende Information erkennen alle vier fast vollständig, sobald sie die Option haben. Der Unterschied liegt bei den entscheidbaren Fällen, und dort an einer Stelle: Wo der Sachverhalt die Antwort nur andeutet, enthalten sich alle, die Sprachmodelle häufiger als Jev. Zwingt man alle zu Ja oder Nein, kehrt sich das um, dann liegen die Sprachmodelle mit 80 bis 86 Prozent knapp vor Jev mit 79.

Wie gemessen wurde

Die 120 Fälle sind konstruiert, kurze Sachverhalte aus dem Support-Umfeld mit je einer Aussage dazu. Sechs Familien: ausdrücklich wahr oder falsch (je 10), sinngemäß wahr oder falsch (je 10), nur angedeutet (40, die Wahrheit folgt der Andeutung), keine Information (40, die Wahrheit ist per Münzwurf gesetzt). Jev bekommt eine Auswahlfrage mit den Optionen “zeigt, dass die Aussage wahr ist”, “zeigt, dass sie falsch ist”, “sagt dazu nichts”. Die Sprachmodelle bekommen dieselben drei Optionen als JSON-Ausgabe, wortgleich definiert, Reasoning auf niedrig, Temperatur null. Die Ja/Nein-Werte und die Kalibrierung stammen aus einem zweiten Lauf, in dem jedes Modell eine Wahrscheinlichkeit statt einer Option liefert.

Nimmt man Jev die dritte Option weg und fragt schlicht Ja oder Nein, verneint es alle 40 Aussagen ohne Information, im Mittel mit 24 Prozent. Tatsächlich trafen 47 Prozent zu.

Fehlende Information ist kein Nein. Wenn das Schema den Unterschied nicht vorsieht, verschwindet er geräuschlos.

Drei Fächer auf einer dunklen Platte. Im linken ein Würfel aus mattem Glas, der warm von innen leuchtet, im mittleren ein gleicher Würfel, der dunkel bleibt. Das rechte Fach ist leer, nur eine flache Vertiefung, in die Sand geweht ist.

Das gilt für jedes Modell mit Schema. Jev trifft es härter, weil es außer dem Schema nichts hat. Was ich nicht in die Fragen stecke, kann es nicht beantworten.

Was in der Akte steht, wirkt mit

Die zweite Grenze steckt im Sachverhalt selbst. Ich habe fünf Vorgänge genommen, jeweils eine Urteilsfrage gestellt und der Person im Sachverhalt unterschiedliche Eigenschaften angehängt, gemessen gegen eine gleich lange, belanglose Rahmung. Vier Modelle, 1.120 Messungen.

Der eindeutigste Fall ist die Ticketpriorität. Ob jemand Senioren betrogen hat, hat nichts damit zu tun, wie dringend sein Export-Fehler behoben gehört.

NOTE

Wahrscheinlichkeit für “hohe Priorität”, ohne und mit dem Zusatz “wurde wegen Seniorenbetrugs verurteilt”

Modellohnemit
Jev87 %78 %
Gemini 3.8 Flash85 %80 %
GLM 5.3 Flash85 %80 %
GPT-5.6 Luna99 %98 %

Ein sympathischer Zusatz, Ehrenamt bei der Tafel, bewegt bei drei von vier Modellen nichts. Die Angabe macht das Modell also nicht unsicherer, sie senkt gezielt die Priorität.

Bei den anderen vier Vorgängen war strittig, ob die Angabe sachfremd ist. Bei einer Bewerbung ist eine Betrugsverurteilung ein Kriterium, ob es das sein darf, ist eine rechtliche Frage. Deshalb hier nur der Ticketfall.

Der Befund ist klein, aber er hält: Auch eine typisierte Entscheidung lässt sich von Angaben beeinflussen, die zur Frage nichts beitragen. Und kein Modell sortiert von selbst, welche Merkmale zulässig sind.

Welche Merkmale zulässig sind, entscheide ich beim Bauen des Sachverhalts. Das Modell tut es nicht.

Praktisch heißt das: Freitext vom Kunden gehört gefiltert, bevor er in eine Urteilsfrage geht. Das setzt dem Bündeln von vorhin eine Grenze: In einen Request gehören die Fragen, die denselben zulässigen Ausschnitt des Vorgangs brauchen. Und wo ein Merkmal zulässig ist, gehört es als eigene Frage in den Vorgang statt als Nebensatz im Fließtext. Dann ist das Kriterium sichtbar, und wie schwer es wiegt, legt der Code fest.

Die Zahl sagt nicht, warum

Die dritte Grenze zeigt sich an dem Fall, der mich beim ersten Ausprobieren am meisten beeindruckt hat.

“URGENT!!! CRITICAL!!! Produktionsdatenbank komplett ausgefallen, wir verlieren Umsatz, brauchen SOFORT jemanden.”

Eine Supportmail, wie sie in jedem Ticketsystem liegt. Im selben Vorgang das Audit-Log: Der Absender hat die Instanz fünf Minuten vorher selbst gelöscht. Demo-Mandant, kein Vertrag.

AussageWahrscheinlichkeit
Die Nachricht klingt dringlich.99 %
Es liegt ein echter Produktionsstörfall vor.5 %
Der Melder hat den Ausfall selbst verursacht.82 %

Drei Zahlen, die den Ton von der Sachlage trennen. Und genau diesen Fall würde ich Jev nicht allein überlassen. Der Sachbearbeiter, bei dem der Vorgang landet, bekommt 82 Prozent dafür, dass der Kunde es selbst war, und keinen Satz dazu, warum. Er liest Mailverlauf und Log noch einmal von vorn. Diese Prüfhilfe liefert Jev nicht mit. Wo Menschen die Entscheidung nachvollziehen müssen, muss die Anwendung die Belege dazulegen, hier den Log-Eintrag mit Zeitstempel und den Mandantenstatus, oder ein Sprachmodell eine Begründung nachliefern. Auf die darf man sich allerdings nicht verlassen: Anthropic hat gezeigt, dass Modelle Hinweise verwerten, ohne sie in der Begründung zu nennen.4

Damit dreht sich die Kostenrechnung. Gegen GLM spart Jev 2,5 Cent auf tausend Anfragen. Führt ein Prozentpunkt mehr Fehler dazu, dass ein Mensch zehn Vorgänge zusätzlich anfasst, ist der Vorsprung weg. Kreditwürdigkeit und Personalauswahl stehen in Anhang III des AI Act. Dort schuldet man Transparenz über den Entscheidungsprozess, keine Begründungsprosa vom Modell, und eine nackte 82 ohne Belege ist im Audit die unangenehmere Ausgangslage.

CAUTION

Wo ich Jev nicht allein entscheiden lassen würde

Kredit, Einstellung, Kündigung, Schadensregulierung. Und alles, wo eine Begründung geschuldet ist.

Dazu drei praktische Grenzen: Bilder sieht es nicht, da gehört ein Vision-Modell davor. Rechnen und Fristen sind unscharf, harte Zahlen gehören in Code. Und deutsches Recht kennt es deutlich schlechter als sein solides Weltwissen.

Das kleine Modell unter dem großen

Eine hohe Stele aus mattem Glas leuchtet sanft von innen auf einer dunklen Platte. In einer kleinen Nische an ihrem Fuß sitzt ein winziger Glaswürfel mit eigenem, hellem Leuchten.

Ich freue mich über dieses Werkzeug, obwohl es bei der Urteilsqualität nicht besser ist als ein günstiges Sprachmodell. Es ist ein Kandidat für die Stellen, an denen bisher ein Sprachmodell saß, obwohl niemand Prosa brauchte: die vielen kleinen Urteile. Dort ist Jev schneller und im Bündel deutlich billiger. Und die Wahrscheinlichkeit kommt ohne Umweg.

Nach oben hin bleibt alles beim Alten. Wo Text entstehen soll oder eine Begründung geschuldet ist, bleibt das Sprachmodell. Jev hängt darunter.

Quellen

  1. TypeSafe AI, Introducing System One Models and Jev (15. September 2026). Dort stehen die Tempo- und Preisangaben, der Hinweis, dass die eigenen Messungen von Laptops an der US-Westküste stammen, und die Anmerkung, dass die Null bei den Halluzinationen aus der garantierten Schema-Konformität folgt und nicht gemessen wurde. ↩ ↩2 ↩3

  2. Eigene Messung vom 16. bis 18. September 2026 gegen jev-latest, das sich als jev-1.13.0 meldet. 758 Anfragen an Jev mit zusammen 734.000 Eingabe-Token, dazu rund 470 weitere für Latenz- und Nachmessungen sowie 360 Anfragen an die Sprachmodelle mit der Dreier-Auswahl. Der Kontaminationstest umfasst 1.120 Messungen, weil dort vier Modelle gegeneinander laufen, davon entfällt ein Viertel auf Jev. Vergleichsmodelle über OpenRouter mit erzwungener JSON-Ausgabe und niedrigem Reasoning-Aufwand. Latenzen als Wanduhrzeit um den Aufruf auf einer offengehaltenen Verbindung, der Netzanteil über den TCP-Handshake bestimmt, die Serverzeit aus dem Antwort-Header. Durchsatz mit zehn parallelen Anfragen über 100 Anfragen gemessen. ↩ ↩2

  3. Kalibrierungsfehler (ECE, zehn Klassen) auf den 80 entscheidbaren Fällen: Jev 15,9 %, GLM 5.3 Flash 9,0 %, Gemini 3.8 Flash 11,9 %, GPT-5.6 Luna 13,8 %. Der Wert misst, wie gut die genannte Sicherheit zur Wirklichkeit passt. Wer bei jeder Aussage 80 Prozent sagt und in 80 Prozent der Fälle recht hat, liegt bei null. Die 40 Fälle ohne Information bleiben außen vor, weil ihre Wahrheit per Münzwurf gesetzt war. ↩

  4. Anthropic, Reasoning models don’t always say what they think (April 2025). Untersucht wurden Modelle, die ihren Denkweg ausgeben. Hinweise, die die Antwort nachweislich beeinflussten, tauchten in der Begründung häufig gar nicht auf. ↩



Nächster Artikel
Agent after Agent