Künstlich erzeugtJev: kein Chatbot. Ein Entscheidungsmodell.
State rein, typisierte Wahrscheinlichkeiten raus. Der teure Teil der LLM-Call-Schleife fällt weg.
Jev ist keine weitere Chat-KI. Es ist eine neue Modellklasse, die keine Sätze schreibt. Statt Text liefert es typisierte Entscheidungen: eine Kategorie, einen Score, eine Ja/Nein-Wahrscheinlichkeit, plus eine Confidence-Zahl, auf die dein Code sofort reagieren kann. Start: 15. September 2026. Firma: TypeSafe AI. Seed: 40 Millionen Dollar, Lead DCVC. Der Name nickt zum Ökonomen William Stanley Jevons: wird etwas massiv billiger, verbrauchen Menschen davon viel mehr.
Kein Chatbot. Kein Parser in der Mitte. Typed decisions.
Du schickst State und Questions. Jev antwortet in einem parallelen Pass mit strukturierten Werten, nicht mit Prosa.
State ist ein String, ein JSON-Objekt oder ein Array von Text: Support-Ticket, E-Mail, Kundenakte, Game-Snapshot. Questions sind eine oder mehrere typisierte Fragen über diesen State. Jev beantwortet alle in einem Durchlauf.
TypeSafe AI sitzt in San Francisco, gegründet 2024 von Diogo Almeida (CEO), Erik Gafni und Sasha Sheng. Almeida war rund vier Jahre bei OpenAI an RLHF, InstructGPT, ChatGPT und GPT-4, bevor er etwas baute, das Computer ohne Parser in der Mitte fressen können. Am 15. September 2026 kam jev-1.13.0 (jev-latest). Dazu 40 Millionen Dollar Seed, Lead DCVC.
TypeSafe nennt das ein System-One-Modell, nach Daniel Kahnemans schnellem, intuitivem System 1. Chat-Modelle liegen näher an System 2: langsam, verbal, abwägend. Jev ist für die tausend kleinen Urteile gebaut, die Software sowieso jede Sekunde fällt: Ticket routen, Nachricht flaggen, Lead scoren.
Choice, Score, Noul. Schema fest. Keine vierte Kategorie.
Eine Option aus einer Liste
Bis 255 Optionen. Zurück: Gewinner, Wahrscheinlichkeit je Option, Confidence.
Bewertung gegen deine Rubrik
State gegen eine geordnete Skala, die du definierst. Kein freier Fließtext-Score.
Bernoulli / Ja-Nein
TypeSafes Name für die Ja/Nein-Frage. Wahrscheinlichkeit zwischen 0 und 1, dass die Aussage wahr ist.
Weil das Output-Schema vorher feststeht, kann Jev keine vierte Kategorie erfinden und die Antwort nicht in einen Absatz wickeln. Halluzination im üblichen LLM-Sinn ist strukturell draußen. Unsicherheit steckt in einer Zahl.
$0,042 pro Million Input-Tokens. Output gratis. Oft unter einer halben Sekunde.
$42 / 1B
Output-Tokens
Rate Limits laut Spec: 250.000 Tokens/Sekunde, 1.200 Requests/Minute. Input nur Text. Auf TypeSafes eigenen Workflow-Evals lag Jev bei 67,8 % Accuracy gleichauf mit Claude Sonnet 5, bei $0,0004 pro Case gegen $0,1174 und 0,4 Sekunden gegen 78 Sekunden. Das sind Vendor-Zahlen am oberen Rand dessen, was du in freier Wildbahn erwarten solltest.
Unabhängige Early Tester waren weniger dramatisch, aber in dieselbe Richtung. Ein Vercel-Engineer ersetzte einen OpenAI-Classifier und sah 5–18× schneller. Ein Bryo-AI-CTO fand Gemini bei E-Mail-Klassifikation leicht genauer, Jev aber 10–20× billiger und die echten Probability-Scores nützlicher für Automation. Die Nachfrage nach Launch war hoch genug, dass TypeSafe die API kurz nicht bedienen konnte.
Nur synthetische Daten. RLCD statt RLHF.
Almeida sagt: Jev wurde nur auf synthetischen Daten trainiert, mit einer Methode namens Reinforcement Learning for Calibrated Decisions (RLCD). Ziel ist nicht „schreib Text, den Menschen mögen“ (RLHF). Ziel ist: Wahrscheinlichkeiten so zuweisen, dass sie treffen, wie oft diese Entscheidung wirklich korrekt ist. Die synthetische-Daten-Wette hält er für besser als RLHF selbst.
Architektur: Transformer-basiert. Gewichte und Paper: nicht veröffentlicht. Außenstehende vermuten ein Open-Weight-LLM darunter mit anderem Sampler und anderem Trainingsziel. Unbestätigt.
AI-native if. Nicht Claude Code. Nicht Cursor.
Klassischer Code: jede Überweisung über $10.000 flaggen. Jev: ganzen Kontext lesen, „suspicious, 0.91“ in ein paar hundert Millisekunden.
Gute Fits: Ticket- und E-Mail-Routing. Safety- und Policy-Klassifikation. Lead-Scoring und Priorität. Model-Routing (billiger First-Pass, teures LLM nur bei niedriger Confidence). Echtzeit-Loops in Games, Agents und Tools. Jedes „AI-native if“, das früher eine volle Chat-Completion kostete.
Kein Fit: E-Mails, Code oder Erklärungen schreiben. Offener Chat. Bilder, Audio, Video (erstmal nur Text). Drop-in-Ersatz für Claude Code, Cursor oder Copilot. Die brauchen weiter ein generatives Modell. Jev sitzt darunter als Entscheidungsschicht.
Engineer Paarangat Rai hat die sauberste Kurzform: Jev ist ein AI-native if.
Vier Jahre Optimierung auf Menschensprache. Automation blieb teuer und brüchig.
Generate text, parse JSON, retry wenn das Schema bricht, hoffen dass das Modell kein Feld erfindet. Das war der Stack.
Jev dreht die Schnittstelle um. Unstrukturierter State rein, typisierte probabilistische Entscheidungen raus. Der teure Teil eines LLM-Calls — Token für Token samplen — fällt weg. Output ist gratis, weil es fast keinen Output gibt.
Das macht Jev nicht „schlauer als GPT“. Es macht eine andere Form von Intelligenz billig genug für die innere Schleife von Software. Almeidas Pitch ist nicht AGI. Es ist komponierbare, maschinen-native Intelligenz, die andere Programme stapeln können.
Vendor-Evals. Kalibrierung ist Gruppeneigenschaft. Englisch am stärksten.
- Accuracy-Claims stehen noch stark auf Vendor-Evals. Dritte Checks sind ermutigend bei Cost und Latency, mixed-to-good bei roher Accuracy.
- Kalibrierung ist eine Gruppeneigenschaft. 0,87 ist keine Garantie für den Einzelfall.
- Low-Confidence-Antworten brauchen weiter einen Menschen oder ein größeres Modell. Jev schiebt das Halluzinationsproblem in eine Zahl, die du thresholden musst.
- Englisch ist am stärksten. Andere Sprachen laufen, mit niedrigerer Accuracy.
- Proprietary und hosted. Keine lokalen Weights.
Eine Woche nach Launch ist Jev weniger Forschungskuriosität als neues Primitiv. Chat-Modelle werden weiter schreiben. Entscheidungsmodelle fangen an zu entscheiden — zum Preis und zur Latency eines Function Calls.
| Behauptung | Korb | Woher |
|---|---|---|
| Launch jev-1.13.0 / jev-latest am 15. September 2026 | Fakt, Vendor | TypeSafe AI Launch-Material, Stand der Notiz |
| TypeSafe AI: Diogo Almeida (CEO), Erik Gafni, Sasha Sheng; SF; gegründet 2024 | Fakt, Vendor | Firmen- und Launch-Angaben |
| $40M Seed, Lead DCVC | Fakt, Vendor | TypeSafe Seed-Ankündigung |
| Input $0,042 / 1M Tokens, Output gratis, Latency 70–500 ms, Context 64k | Fakt, Spec | Offizielle Specs jev-1.13.0 |
| Rate limit 250k Tokens/s, 1.200 RPM | Fakt, Spec | Offizielle Specs |
| 67,8 % Accuracy gleichauf Claude Sonnet 5; $0,0004 vs $0,1174; 0,4 s vs 78 s | Vendor-Eval | TypeSafe Workflow-Evals, selbst berichtet |
| Peak 193,6× schneller, 444,6× billiger | Vendor-Peak | TypeSafe, oberes Ende der Erwartung |
| Vercel: 5–18× schneller vs OpenAI-Classifier | Early Tester | Unabhängiger Bericht, Early Access |
| Bryo AI: Gemini leicht genauer, Jev 10–20× billiger, Probability-Scores nützlicher | Early Tester | CTO-Feedback, Early Access |
| Training: nur synthetische Daten, RLCD; keine öffentlichen Weights | Vendor-Aussage | Almeida / TypeSafe |
| Drei Primitive: Choice, Score, Noul | Produkt | TypeSafe API-Modell |
- TypeSafe AI / Jev LaunchProdukt, Specs jev-1.13.0, Seed, Primitive, System-One-Framing.https://typesafe.ai/
- William Stanley JevonsNamensgeber: wird etwas billiger, steigt der Verbrauch.https://en.wikipedia.org/wiki/William_Stanley_Jevons
- Daniel Kahneman, Thinking, Fast and SlowSystem 1 / System 2 als Framing für TypeSafes „System One model“.https://en.wikipedia.org/wiki/Thinking,_Fast_and_Slow
- OpenAI — RLHF / InstructGPT-LinieHintergrund Almeida (RLHF, InstructGPT, ChatGPT, GPT-4) vor TypeSafe.https://openai.com/index/instruction-following/
Jev: kein Chatbot. Ein Entscheidungsmodell. 22. September 2026. McGrinsey Writing Skill. Vendor-Evals als Vendor-Evals gekennzeichnet. Early-Tester-Berichte als Early Access.


