Jev:把語言從 LLM 裡刪掉,換來一個只回選項機率、附校準信心的 System 1 分類器
文字解析 · 1 支影片 · 產生於 2026-10-01 00:54
章節(5)
1. Outline
- 起點 · An ex-OpenAI researcher just deleted language from the LLM...
Fireship 五分鐘拆解 Jev:從 LLM「不會閉嘴」的痛點,到型別安全的三種回傳形狀、System 1 定位、校準信心值,最後檢視「它是不是新東西」的三種質疑與 OpenJev 的重現。
2. YouTuber 的思維推導
An ex-OpenAI researcher just deleted language from the LLM...
Fireship · 5m27s · 字幕 en · vision=on (input 指定 vision=true。Fireship 影片畫面資訊密度高(程式碼、對照數字、demo 畫面),挑 4 張看了才懂的畫面。) · YouTube
預估 vs 實際耗時
| 階段 | 預估 | 實際 |
|---|---|---|
| fetch | 6s | 2s |
| segment | 41s | 2m30s |
| shot | 25s | 2s |
| analyze | 3m45s | 5m29s |
| render | 5s | – |
Fireship 從一個很具體的痛點出發:LLM 是「不會閉嘴」的文字生成器,連只需要一個 bit 的 true / false 問題都要先生出幾千個思考 token 再收費。接著他把 Jev 的來頭(前 OpenAI instruction-following 研究員、兩年 stealth、剛募 4,000 萬美元)與宣稱(200 倍快、400 倍便宜、輸出 token 免費、零幻覺)攤開,然後自己說「聽起來太好」,把影片定調成檢驗而不是宣傳。檢驗分三層:第一層看介面——公司名 Typesafe 是線索,Jev 收的是強型別的問題,只能回三種形狀(choice / score / noul),型別錯誤在數學上不可能;第二層看定位——這是 Kahneman 意義下的 System 1 模型,靠直覺快答,所以便宜到可以做審核、遊戲 NPC、即時計算機這種以前塞不進去的場景;第三層拆掉「型別安全」的幻覺——形狀對不等於答案對,也不是確定性的,所以每個回答附一個經 RLCD 校準過的信心值,讓開發者自己設門檻。
最後回到「它到底怎麼做到的」:官方不公開架構,而懷疑者指出它跟十多年前的 zero-shot classifier 沒兩樣,甚至有人用一顆凍結的 Qwen 4B、單次 forward pass 讀選項機率就重現了整個介面(OpenJev)。作者的結論不是 Jev 是騙局,而是:不管是新架構還是舊技巧包裝,這種「只回標籤與機率、不生成文字」的快速便宜分類器現在人人做得出來,對開發者是好時代。
推理鏈:每段留給下一段的線索
每一列是一段,箭頭後的字是這段留給下一段的線索。點段落標題跳到該段。
- LLM 的致命缺陷:不會閉嘴 → 「把語言刪掉」之後,模型到底收什麼、回什麼?作者說公司名 Typesafe AI 就是第一條線索。
- Typesafe AI:強型別的問題與三種回傳形狀 → 有了固定形狀的輸出,Typesafe 為什麼把 Jev 叫做「System 1 模型」?這種只會挑選項的模型,實際上能塞進什麼場景?
- System 1 模型與便宜到能即時用的場景 → 回應裡出現了 17% / 83% 這種機率——輸出形狀保證正確,但答案本身呢?下一步要問:型別安全等於正確嗎?那個百分比可以信嗎?
- 型別安全 ≠ 正確:校準過的信心值 → 信心值解決了「能不能信」,但作者還沒回答「它到底怎麼做到的」——下一個問題是 Jev 的架構是什麼,以及它是不是真的新東西。
- 黑箱與質疑:這不就是 zero-shot 分類器?
3. 逐段說明
An ex-OpenAI researcher just deleted language from the LLM...
1. LLM 的致命缺陷:不會閉嘴 0:00–1:18
Fireship 開場:一位曾參與 OpenAI instruction-following(後來成為 ChatGPT)研究的人,隱身兩年後發表新模型 Jev——不會說話、不會寫程式、不會寫作文、也永遠不會說「你完全正確」。動機是 LLM 的一個致命缺陷:你叫它回 true / false,它會思考 4,000 個 token 後發明第三個選項,再收你 11 美分。Jev 的激進解法是「把語言從大型語言模型裡刪掉」,得到一種新型分類器:宣稱快 200 倍、便宜 400 倍、輸出 token 免費、零幻覺。

推理因為「AI 每週都改變世界」已經是老梗,所以作者先用反差建立這次的不同:發表者是 ChatGPT 前身 instruction-following 研究的 OpenAI 成員,兩年 stealth,而模型「不會說話、不會寫程式、不會寫作文、永遠不會說你完全正確」——把「不會做什麼」當賣點。接著點出它要解的痛點:叫 LLM 回 true / false,它會思考 4,000 個 token、發明第三個選項、再收 11 美分。Jev 的激進解法是把語言從 LLM 裡刪掉,得到一種新分類器,宣稱 200 倍快、400 倍便宜、輸出 token 免費、零幻覺。作者自己接一句「好到不像真的」,宣告本片要看三件事:程式碼、Trust-Me-Bro benchmarks、以及聲稱一年前就做過開源版的人。
- C「刪掉語言」= 模型不再生成文字,只從固定選項裡選一個,所以沒有輸出 token、也沒有格式外的輸出。→ 畫地圖
- ETypeSafe 自家對照表:LLM 端到端 3–329 秒、$0.20–10/MTok;Jev 70–500ms、$0.042/MTok。→ 存+演練
- RJev 宣稱的「零幻覺」實際只代表不會產生選項以外的輸出。→ 存+回想
AI 補充作者沒說清楚的是「刪掉語言」在技術上意味著什麼:一般 LLM 的答案是一串 token,每個 token 都要跑一次解碼,推理模型還會先吐出思考鏈;「刪掉語言」就是不再生成文字,只從固定的幾個選項裡選一個(或給一個數字),所以「輸出 token 免費」不是促銷,而是根本沒有輸出 token 可收。截圖(0:52)是 TypeSafe 自己的對照表:LLM 端到端 3–329 秒、輸入 $0.20–$10 / MTok;Jev 70ms–500ms、$0.042 / MTok,表上寫的是「40x–200x faster」,作者口頭取的是區間上限。「零幻覺」在這裡只能理解成「不會產生指定選項以外的東西」,選錯選項仍然是錯,先記著這個保留。另外 transcript 把 Jev 聽成 Jeb / Jeff,是同一個東西。
術語:instruction following
「200 times faster, 400 times cheaper with free output tokens and zero hallucinations」
2. Typesafe AI:強型別的問題與三種回傳形狀 1:19–2:01
Jev 由前 OpenAI 研究員 Diego Almeida 與他的公司 Typesafe AI 打造,剛募資 4,000 萬美元。公司名就是線索:跟一般 LLM 一樣送進問題與非結構化的 context,但它的行為更像 TypeScript 這種型別安全的語言——問題是強型別的,必須回傳指定形狀,三種之一:choice(多選一)、score(分數)、boolean(yes / no)。schema 匹配是保證的,型別錯誤在數學上不可能發生。

推理因為上一段只講了效果沒講介面,所以作者先補來頭(前 OpenAI 研究員 Diego Almeida、公司 Typesafe AI、剛募 4,000 萬美元),再用公司名當鑰匙:輸入端跟一般 LLM 一樣,送一個問題加一堆非結構化的 context;差別在輸出端,它像 TypeScript 這種型別安全語言——你送進去的是一個「強型別的問題」,答案必須是指定形狀之一,而且只有三種:choice(多選一)、score(分數)、noul(基本上就是 yes / no)。因為輸出空間被型別限死,schema 匹配是保證的,型別錯誤在數學上不可能發生——這正是上一段「零幻覺」的來源。
- C強型別的問題:輸入跟 LLM 一樣(問題+非結構化 context),輸出必須是三種形狀之一,schema 匹配是保證的。→ 畫地圖
- CNoul 不只是布林:它是「評估某件事有多真」,回的是 true / false 各自的機率。→ 畫地圖
- AJev 的「型別安全問題」被比成 TypeScript:你宣告回傳型別,型別錯誤就不可能發生。→ 批判類比
- AJev 的 schema 保證 vs LLM 的 structured output / JSON mode:層次不同。→ 批判類比
AI 補充transcript 把第三種形狀聽成「a new」,截圖(1:52)的 Playground 選單寫得很清楚是 **Noul**,說明是「Evaluate how true something is」(評估某件事有多真),而 Score 是「Set up a rubric to grade with」(用評分標準打分)、Choice 是「Ask a multiple choice question」(多選一)。所以 noul 不只是布林值,它的本質是「真的程度」,這一點作者用「yes or no」帶過了。「型別錯誤在數學上不可能」的技術意思是:模型不是自由生成後再用 parser 檢查,而是只能在給定的選項集合裡做選擇,所以根本沒有「格式不對」這種輸出可以產生——跟 LLM 的 structured output / JSON mode 靠事後約束或重試是不同層次的保證。作者這裡把「一定回對形狀」講得很篤定,但還沒碰「回的內容對不對」。
術語:schema matching
3. System 1 模型與便宜到能即時用的場景 2:01–3:01
Typesafe 稱 Jev 是「System 1 模型」,名稱來自 Kahneman《快思慢想》:System 1 靠直覺、快;System 2 慢而深思,像 GPT-6、Claude Fable 這類燒 40,000 token 幫變數取名的推理模型。對想在 app 裡塞便宜快速 AI 的開發者差別很大。作者用 Horse Tinder 舉例:驢子違反服務條款偷用 app,用 Jev 做審核步驟,對「is this a horse」回 boolean 就能即時封鎖。若相信這些 Trust-Me-Bro benchmarks,它比大廠模型便宜 440 倍,快到能做即時應用:遊戲 NPC 行為、世界第一個即時 AI 計算機。

推理因為上一段把 Jev 定義成只回固定形狀的模型,所以作者接著解釋 Typesafe 給它的定位:System 1 模型,名稱來自 Kahneman《快思慢想》——System 1 快、憑直覺;System 2 慢、深思,像 GPT-6、Claude Fable 這些「老古董」推理模型,光幫一個變數取名就燒 40,000 token。這個定位對 app 開發者差別很大:作者用自家 Horse Tinder 示範,驢子違反服務條款偷用 app,於是加一個 AI 審核步驟,對「is this a horse」回一個 noul,不是馬就即時封鎖。接著把「快」推到極致:若相信那些 Trust-Me-Bro benchmarks,它比大廠模型便宜 440 倍,快到能做即時應用——遊戲 NPC 行為、世界第一個即時 AI 計算機。
- CSystem 1 模型 = 不生成中間思考、直接給選項機率;System 2 = 先吐長串推理再作答的推理模型。→ 畫地圖
- ATypesafe 借 Kahneman 的 System 1 / System 2 比喻模型:快而直覺 vs 慢而推理。→ 批判類比
- P把一個 yes / no 判斷寫成 Jev 式呼叫:state(原始 context)+ question(型別、instructions、criteria)。→ 練習
- EHorse Tinder 範例:state 描述一頭驢,問 isHorse,回 17% true / 83% false 兩個機率。→ 存+演練
AI 補充截圖(2:37)補了作者沒念出來的實際呼叫:State 欄位是非結構化的 context「a creature with 4 legs commonly called an ass」,Questions 是一段 JSON——`isHorse` 型別 `noul`、`instructions: "Is this animal a horse?"`、`criteria: { true: "yes it is horse", false: "no not a horse" }`;右側 Response 回的不是一個字,而是 **17% true / 83% false** 兩個選項的機率。這說明上一段說的「回 yes / no」其實是「回兩個選項各自的機率」,程式再依此決定封不封。System 1 / System 2 的比喻要小心:Kahneman 講的是人類的兩種思考模式,這裡只是借「快而直覺 vs 慢而推理」的對比,Jev 並沒有「直覺」,它只是不生成中間思考。作者說的「即時計算機」是玩笑——用分類器做算術正是這種模型不擅長的事。transcript 的「Conorman」= Kahneman,「TMBBBs」= Trust Me Bro Benchmarks。
術語:content moderationreal-time inference
「440 times cheaper than one of the big brand models」
4. 型別安全 ≠ 正確:校準過的信心值 3:01–3:39
輸出型別安全不代表答案正確,而且不是確定性的——同樣的問題與 context 送兩次可能得到不同結果,跟一般 LLM 一樣。為了讓你知道回答品質,每個回應附一個「calibrated confidence」數字。Chat 模型被訓練來討好人類評分者,人類愛信心,所以得到「錯得像 Kanye 一樣有自信」的模型;Jev 的信心來自 RLCD(reinforcement learning for calibrated decisions),回 60% 就代表大約六成的時候是對的。

推理因為上一段把 Jev 講得又快又便宜,所以作者馬上拆掉最容易的誤解:輸出型別安全不代表它總是正確,而且它不是確定性的——同一個問題、同一份 context 送兩次,可能得到不同結果,跟一般 LLM 一樣。那你怎麼知道這次的答案品質?每個回應附一個「calibrated confidence」數字。作者接著解釋為什麼「校準」是重點:chat 模型被訓練來討好人類評分者,而人類愛有自信的回答,所以我們得到「錯得像 Kanye 一樣有自信」的模型;Jev 的信心值則來自 RLCD(reinforcement learning for calibrated decisions),回 60% 就代表大約六成的時候是對的。
- C校準:模型說 70% 的那批答案裡,實際約 70% 是對的——信心值等於命中率,才能直接當機率用。→ 畫地圖
- ARLCD vs RLHF:把獎勵從「人類喜不喜歡」換成「信心值與實際對錯是否一致」。→ 批判類比
- C實務用法不是取最高機率就用,而是設信心門檻:過了自動處理,沒過退回人工或 System 2 模型。→ 畫地圖
- P用信心門檻接自動化:拿機率 → 設門檻 → 過就自動、沒過就退回人工或推理模型。→ 練習
- E作者的示意圖「Confidence levels and thresholds… 12 / 40 PASS」:40 個回答只有 12 個過門檻。→ 存+演練
- RJev 不是確定性的:同一問題、同一 context 送兩次可能得到不同結果。→ 存+回想
- RRLCD 全名 reinforcement learning for calibrated decisions。→ 存+回想
AI 補充作者跳過的一步是「校準」的定義:一個模型是校準的,意思是它說 70% 的那批答案裡,實際上大約有 70% 是對的——信心值等於命中率。一般 LLM 用 RLHF 訓練時,人類評分者傾向給篤定的回答高分,模型學會「裝有自信」,信心與正確率脫鉤,這就是作者說的 Kanye 現象。RLCD 的意思是把獎勵改成「信心值與實際對錯的一致程度」,讓模型說 60% 時真的只有六成對。這解決了上一段留下的問題:17% / 83% 不只是相對大小,而是可以直接當機率用的數字。截圖(3:34)是作者的復古風示意圖「Confidence levels and thresholds… 12 / 40 PASS」:40 個回答只有 12 個過門檻——這就是實務用法:你不是拿最高機率的選項就用,而是設一個信心門檻,過了才自動處理,沒過就退回人工或退回 System 2 模型。「60% of the time it's right every time」是 Anchorman 的哏,不是技術陳述。
5. 黑箱與質疑:這不就是 zero-shot 分類器? 3:39–4:22
Jev 怎麼運作沒人確定,CEO 說架構暫不公開,論文「未來可能會出」。質疑聲:有人說它跟過去的 zero-shot classifier 沒兩樣,而公司沒把功勞歸給十多年前就在做 zero-shot 分類的先驅(如 Jiny Yang);有人宣稱自己一年前發的論文跟 Jev 一模一樣;另一位開發者已做出 OpenJev——用一顆凍結的 Qwen 4B,在單次 forward pass 裡讀取各選項的機率,就重現了整個介面,不需要新訓練、一張 3090 就能跑,還有瀏覽器裡直接跑的 WebGPU demo。作者結尾:現在是當開發者的好時代。

推理因為前四段都在講 Jev 做了什麼,所以作者最後問「它怎麼做到的」——答案是沒人確定:CEO 說架構暫不公開,論文「未來可能會出,也許」。既然官方沒說,作者就列出質疑:有人說它跟過去的 zero-shot classifier 沒兩樣,而公司沒把功勞歸給十多年前就在做 zero-shot 分類的先驅;有人宣稱自己一年前發的論文跟 Jev 一模一樣;最有力的是另一位開發者已做出 OpenJev——用一顆凍結的 Qwen 4B,在單次 forward pass 裡讀取各選項的機率,就重現了整個介面,不需要任何新訓練,一張 3090 就能跑,還有瀏覽器裡直接跑的 WebGPU demo。作者收尾:不管 Jev 是不是新東西,現在是當開發者的好時代。
- CZero-shot 分類:把問題與選項寫成 prompt 給現成 LLM,不生成,只讀它對每個選項的 logit,softmax 就是機率。→ 畫地圖
- C單次 forward pass 同時解釋「輸出 token 免費」「零幻覺」「200 倍快」:沒有解碼迴圈、輸出空間鎖死。→ 畫地圖
- EOpenJev:凍結 Qwen 4B,單次 forward pass 讀選項 logits → 機率,無需訓練,一張 3090 可跑。→ 存+演練
- P自己驗證 zero-shot 分類:開 OpenJev 的 WebGPU demo,用同一題跑多次看機率。→ 練習
AI 補充截圖(4:15)的 OpenJev 流程圖是全片唯一的技術線索:Unstructured state(非結構化 context)、Runtime criteria(執行期的評分標準)、Typed options(型別化的選項)三者一起餵進 4B model,模型輸出 **native option logits**,再轉成 Probabilities。翻譯成白話:把問題和選項寫成 prompt 給一個現成的 LLM,但不讓它生成——只跑一次前向運算,看它對每個選項(例如「true」「false」這幾個 token)的原生 logit 各是多少,softmax 之後就是各選項的機率。這正好對上前面看到的 17% / 83%,也解釋了為什麼「輸出 token 免費」「零幻覺」「200 倍快」:因為只有一次 forward pass、沒有解碼迴圈、輸出空間被鎖死。它也解釋了為什麼不是確定性的(logits 受批次與數值精度影響)。OpenJev 沒重現的是 RLCD 校準——凍結的 Qwen 沒經過校準訓練,它的機率是否可信是另一回事,這可能才是 Typesafe 真正的附加價值。transcript 的「zeroot」= zero-shot、「Quen」= Qwen。作者對「誰先發明」不下結論,只呈現三方說法。
術語:zero-shot classificationfrozen model
4. 總結
作者先用「LLM 叫它回 true / false 也會燒 4,000 token」建立痛點,Jev 的解法是把語言刪掉——不生成文字,只從固定選項選一個,所以輸出 token 免費、不會產生格式外的東西。接著用公司名 Typesafe 解釋介面:問題是強型別的,答案只能是 noul / choice / score 三種形狀,schema 匹配是保證的。這種模型被定位成 System 1(快、不生成中間思考),對 app 開發者的價值是便宜到能做即時審核與 NPC 行為;Horse Tinder 的 Playground 顯示 noul 回的其實是 17% / 83% 兩個機率。但型別安全不等於正確,也不是確定性的,所以每個回應附 calibrated confidence——由 RLCD 訓練,讓 60% 真的代表六成命中率,實務上用信心門檻決定自動處理或退回人工。最後作者問「它怎麼做到的」:官方不公開,而 OpenJev 用凍結的 Qwen 4B 單次 forward pass 讀選項 logits 就重現了介面,這既解釋了所有「快、便宜、零幻覺」的來源,也讓「Jev 是不是新東西」變成開放問題——唯一沒被重現的是校準訓練。
勘誤總整理
確定錯誤/已過時見仁見智(取決於版本或情境)
| 段落 | 原話(transcript 逐字) | 說明 |
|---|---|---|
| 1. LLM 的致命缺陷:不會閉嘴 0:50 |
「200 times faster, 400 times cheaper with free output tokens and zero hallucinations」 | 同一畫面上 TypeSafe 自己的對照表寫的是「40x–200x faster」(70ms–500ms vs 3–329 秒),200 倍是區間上限;價格 $0.042 vs $0.20–$10 / MTok 算起來約 5–240 倍,「400 倍」要把輸出 token 免費一起算才湊得到。這些數字全是廠商自報,作者後面也自稱它們是 Trust-Me-Bro benchmarks。「零幻覺」只在「不會產生選項以外的輸出」的意義下成立,不代表選對。 依據: 影片 0:52 畫面上的 TypeSafe LLM vs Jev 對照表 |
| 3. System 1 模型與便宜到能即時用的場景 2:45 |
「440 times cheaper than one of the big brand models」 | 同一支影片前面說的是 400 倍,這裡變 440 倍;依 0:52 對照表 $10 vs $0.042 / MTok 約 238 倍,要選特定最貴的模型並把輸出 token 一起算才會到 400 以上。作者自己也用「if we are to believe these Trust Me Bro Benchmarks」帶過,這是廠商自報數字。 依據: 影片 0:52 的 TypeSafe 對照表;影片 0:50 的「400 times cheaper」 |
5. 推薦三個下一步
1. 往下挖深:zero-shot 分類與讀 logits 的原理
影片只給了 OpenJev 的流程圖;要真正理解「單次 forward pass 讀選項 logits」,得自己看一次 logits → softmax 的實作與 label word 的選法。
YouTube 搜尋:zero-shot classification LLM logits next token probabilities classification transformers OpenJev Qwen 4B
2. 往旁邊對照:模型校準與 RLHF 的過度自信
RLCD 是 Jev 唯一沒被開源重現的部分;對照 calibration 的既有研究才能判斷它是不是真的附加價值。
YouTube 搜尋:LLM calibration explained expected calibration error RLHF overconfidence calibration
3. 往上應用:用信心門檻設計 human-in-the-loop 審核流程
影片停在「設門檻」一句話;實際上門檻怎麼依錯誤代價選、沒過的怎麼退回 System 2 模型,是把 Jev 接進產品的關鍵。
YouTube 搜尋:confidence threshold human in the loop moderation LLM router fast model fallback content moderation classifier confidence
- 接著看 →Jev + Treg is a crazy combo for automation... · 那站講 Jev 為何刪掉語言、noul/choice/score 與校準信心;這站拿它接 Treg 蓋出三條生產管線
- 接著看 →Building a Harness with Jev · 那站解釋 Jev 為何不生成文字、noul/choice/score;這站把它掛進 agent loop 的 routing、auto mode、judge