Zum Inhalt springen

TypeSafe Jev: ein Modell, das nur entscheidet

TypeSafe Jev beantwortet typisierte Fragen in rund 100 Millisekunden. Was das Modell kann, wo es scheitert und was es für Agent Workflows heißt.

Eine typisierte Frage, drei Antwortformen: Die Frage geht mit dem Zustand, auf den sie zielt, Ticket, Diff, Logs, in Jev hinein, und eine von drei typisierten Antworten kommt heraus, Choice, Score oder Noul, jede mit ihrem Confidence Wert.
Auf dieser Seite 5 Abschnitte

Am 15. September ist TypeSafe AI aus dem Stealth Modus gekommen, mit 40 Millionen Dollar Seed Finanzierung unter Führung von DCVC und einem ersten Modell namens Jev. Seitdem taucht es in fast jedem Entwicklerblog auf, obwohl es weder chatten noch Code schreiben kann. Für Teams, die mit KI Agenten arbeiten, ist es trotzdem eines der interessanteren Releases dieses Jahres.

Was Jev ist

Hinter TypeSafe steht Diogo Almeida, der bei OpenAI an RLHF und InstructGPT mitgearbeitet hat, also an den Trainingsmethoden hinter ChatGPT. Jev ist bewusst kein Sprachmodell im üblichen Sinn. Man schickt ihm einen Zustand, etwa ein Ticket, eine Logzeile oder einen Shell Befehl. Dazu kommt eine Liste von Fragen mit festgelegten Antwortformen. Davon gibt es drei: eine Ja/Nein Frage (bei TypeSafe „Noul“), eine Auswahl aus vorgegebenen Optionen („Choice“) und eine Einordnung auf einer Skala, deren Stufen man selbst beschreibt („Score“). Zurück kommt kein Text, sondern pro Frage eine Wahrscheinlichkeitsverteilung plus ein Konfidenzwert.

Drei Karten zeigen die Antwortformen Noul, Choice und Score mit Wahrscheinlichkeiten
Die drei Fragetypen. Die möglichen Antworten legt man vorher fest, zurück kommt eine Verteilung plus Konfidenz.

Flavio Copes beschreibt Jev in seinem ausführlichen Test als eine Art intelligentes if Statement. Normaler Code verzweigt auf Werte, die er berechnen kann. Sobald die Bedingung ein Urteil ist, etwa ob ein Befehl gefährlich ist oder ein Ticket genug Informationen enthält, brauchte man bisher ein großes Sprachmodell oder eine Regex, die bei jedem Sonderfall bricht.

TypeSafe nennt folgende Eckdaten: Die meisten Aufrufe dauern rund 100 Millisekunden, Input kostet 0,042 Dollar pro Million Tokens und Output ist kostenlos. Alle Fragen zu einem Zustand werden parallel beantwortet, eine zusätzliche Frage verlängert die Antwortzeit also kaum. Trainiert wurde mit einem eigenen Verfahren namens Reinforcement Learning for Calibrated Decisions. Es soll dafür sorgen, dass eine Antwort mit 90 Prozent Wahrscheinlichkeit auch in etwa 90 Prozent der Fälle stimmt.

Balkenvergleich von Zeit pro Entscheidung und Preis pro Million Input Tokens, logarithmisch
Zeit und Preis pro Entscheidung im Vergleich, auf logarithmischen Achsen. Alle Werte stammen aus TypeSafes eigenen Messungen.

Wo so ein Modell in einem Agent Workflow sitzt

Ein Coding Agent trifft auf dem Weg vom Ticket zum Pull Request viele kleine Entscheidungen, die mit Schreiben nichts zu tun haben. Ist das Ticket klar genug, um loszulegen? Braucht die Aufgabe ein schnelles oder ein starkes Modell? Darf dieser Befehl ohne Rückfrage laufen? Passt der fertige Pull Request zu dem, was im Ticket stand? Heute beantwortet diese Fragen meist dasselbe große Modell, das auch den Code schreibt, mit entsprechender Wartezeit und entsprechenden Kosten.

Playbook Run vom Ticket bis zum Pull Request mit Schritten, Entscheidungen und Gates
Ein Playbook Run, vereinfacht. Violett sind die Schritte, in denen ein Sprachmodell schreibt, gelb die Entscheidungen dazwischen.

Die ersten Integrationen zeigen, wohin das geht. LangChain hat zum Start eine Middleware veröffentlicht, die Anfragen per Jev an ein günstiges oder ein starkes Modell verteilt, dazu eine zweite, die Tool Aufrufe vor der Ausführung auf Risiko prüft. Bei Browser Use ist ein Agent entstanden, der auf Google Flights in gut sieben Sekunden einen Flug heraussucht, weil jeder Klick eine Auswahl aus nummerierten Seitenelementen ist und nur das Eintippen von Text noch ein Sprachmodell braucht. Andere haben Code Reviews in eine Risikomatrix pro Datei zerlegt, die Jev befüllt.

In all diesen Beispielen schreibt das Sprachmodell weiterhin den Text oder den Code. Jev entscheidet über den nächsten Schritt, während Schleife, Sicherheitsregeln und Rechenarbeit in normalem Code bleiben.

Was man nüchtern sehen sollte

Jev ist zwei Wochen alt. Direkt bei TypeSafe läuft der Zugang noch über eine Warteliste, ohne Wartezeit geht es über Vercels AI Gateway. Die Schlagzeilen mit fast 200 mal schneller und über 400 mal günstiger stammen aus TypeSafes eigenen Tests. TypeSafe selbst ordnet sie am oberen Ende der realen Ergebnisse ein. Auch der Genauigkeitsvergleich hat einen Haken: Es gibt keine unabhängige Grundwahrheit, gemessen wird die Übereinstimmung mit dem gemittelten Urteil zweier Frontier Modelle. Nachgemessen hat das von außen bisher niemand.

Die Aussage, Jev könne nicht halluzinieren, ist enger gemeint, als sie klingt. Das Modell kann keinen Wert außerhalb der vorgegebenen Optionen liefern, wohl aber die falsche erlaubte Option. TypeSafe dokumentiert außerdem offen, wo Jev schwach ist: Es zählt nicht zuverlässig, vergleicht Datumsangaben nicht sicher und liest Fragen sehr wörtlich. Bilder, Audio oder Video versteht es bisher nicht.

Was das für Teams heißt

Die eigentliche Nachricht steckt weniger im Modell selbst als in dem, was es über die Architektur von KI Systemen sagt. Der Entwickler Hassan El Mghari hat 1.018 Forschungspaper zusammenfassen und klassifizieren lassen. Die Zusammenfassungen durch ein Sprachmodell kosteten 3,99 Dollar, die Klassifikation mit Jev 8 Cent. Sein Schluss daraus: Künftig arbeiten für verschiedene Teile eines Workflows verschiedene Modelle, statt eines für alles.

Für Engineering Teams folgt daraus ziemlich direkt, wie ein gutes Setup gebaut sein sollte. Die Arbeit muss in klare Schritte zerlegt sein, sonst weiß niemand, an welcher Stelle eine schnelle Entscheidung reicht und wo ein starkes Modell nachdenken muss. Jeder Schritt braucht ein Ergebnis, das Code prüfen kann. Die Modelle müssen außerdem austauschbar sein, weil der nächste neue Modelltyp mit Sicherheit kommt, vermutlich schneller als gedacht.

Wer Jev ausprobieren will, fängt am besten mit einer einzigen unspektakulären Entscheidung an, die heute ein großes Modell oder eine fragile Regel trifft. Jev läuft zunächst nur mit und schreibt seine Antworten ins Log. Danach vergleicht ihr die Konfidenzwerte mit dem, was tatsächlich richtig war. Automatisiert wird zuerst der Fall, bei dem ein Fehler wenig kostet. Fragen und Schwellenwerte gehören dabei in eine gemeinsame Datei, weil das der Teil ist, den ein Mensch reviewen muss.

Bei Kadmo arbeiten spezialisierte Agenten nach Playbooks, in denen jeder Schritt mit einem Gate endet, also einem klaren Urteil pass, stop oder pause. Das Modell dahinter ist jederzeit austauschbar. In eine solche Struktur lassen sich neue Modelltypen wie Jev dort einsetzen, wo sie ihre Stärke haben. Wenn ihr sehen wollt, wie das bei euch aussehen kann, zeigen wir es euch gern.

Quellen

Weiterlesen

Alle Artikel

10x Ihr Engineering-Output.Qualität gehalten.

Läuft innerhalb von Tagen. Probieren Sie es an einer Sache aus Ihrem Backlog, sehen Sie das Ergebnis, dann entscheiden Sie.