Jev:把語言從 LLM 裡刪掉,換來一個只回選項機率、附校準信心的 System 1 分類器

文字解析 · 1 支影片 · 產生於 2026-10-01 00:54

🎧 語音解析✍️ 練習

🎧 語音解析 10m34s · TTS 講解與作者原聲交錯;點章節可跳。
邊聽邊看逐句講稿,點任一句從那裡開始
章節(5)

1. Outline

  1. 起點 · An ex-OpenAI researcher just deleted language from the LLM...
    Fireship 五分鐘拆解 Jev:從 LLM「不會閉嘴」的痛點,到型別安全的三種回傳形狀、System 1 定位、校準信心值,最後檢視「它是不是新東西」的三種質疑與 OpenJev 的重現。

2. YouTuber 的思維推導

An ex-OpenAI researcher just deleted language from the LLM...

Fireship · 5m27s · 字幕 en · vision=on (input 指定 vision=true。Fireship 影片畫面資訊密度高(程式碼、對照數字、demo 畫面),挑 4 張看了才懂的畫面。) · YouTube

預估 vs 實際耗時
階段預估實際
fetch 6s 2s
segment 41s 2m30s
shot 25s 2s
analyze 3m45s 5m29s
render 5s –

Fireship 從一個很具體的痛點出發:LLM 是「不會閉嘴」的文字生成器,連只需要一個 bit 的 true / false 問題都要先生出幾千個思考 token 再收費。接著他把 Jev 的來頭(前 OpenAI instruction-following 研究員、兩年 stealth、剛募 4,000 萬美元)與宣稱(200 倍快、400 倍便宜、輸出 token 免費、零幻覺)攤開,然後自己說「聽起來太好」,把影片定調成檢驗而不是宣傳。檢驗分三層:第一層看介面——公司名 Typesafe 是線索,Jev 收的是強型別的問題,只能回三種形狀(choice / score / noul),型別錯誤在數學上不可能;第二層看定位——這是 Kahneman 意義下的 System 1 模型,靠直覺快答,所以便宜到可以做審核、遊戲 NPC、即時計算機這種以前塞不進去的場景;第三層拆掉「型別安全」的幻覺——形狀對不等於答案對,也不是確定性的,所以每個回答附一個經 RLCD 校準過的信心值,讓開發者自己設門檻。

最後回到「它到底怎麼做到的」:官方不公開架構,而懷疑者指出它跟十多年前的 zero-shot classifier 沒兩樣,甚至有人用一顆凍結的 Qwen 4B、單次 forward pass 讀選項機率就重現了整個介面(OpenJev)。作者的結論不是 Jev 是騙局,而是:不管是新架構還是舊技巧包裝,這種「只回標籤與機率、不生成文字」的快速便宜分類器現在人人做得出來,對開發者是好時代。

推理鏈:每段留給下一段的線索

每一列是一段,箭頭後的字是這段留給下一段的線索。點段落標題跳到該段。

  1. LLM 的致命缺陷:不會閉嘴 → 「把語言刪掉」之後,模型到底收什麼、回什麼?作者說公司名 Typesafe AI 就是第一條線索。
  2. Typesafe AI:強型別的問題與三種回傳形狀 → 有了固定形狀的輸出,Typesafe 為什麼把 Jev 叫做「System 1 模型」?這種只會挑選項的模型,實際上能塞進什麼場景?
  3. System 1 模型與便宜到能即時用的場景 → 回應裡出現了 17% / 83% 這種機率——輸出形狀保證正確,但答案本身呢?下一步要問:型別安全等於正確嗎?那個百分比可以信嗎?
  4. 型別安全 ≠ 正確:校準過的信心值 → 信心值解決了「能不能信」,但作者還沒回答「它到底怎麼做到的」——下一個問題是 Jev 的架構是什麼,以及它是不是真的新東西。
  5. 黑箱與質疑:這不就是 zero-shot 分類器?

3. 逐段說明

An ex-OpenAI researcher just deleted language from the LLM...

1. LLM 的致命缺陷:不會閉嘴 0:00–1:18

Fireship 開場:一位曾參與 OpenAI instruction-following(後來成為 ChatGPT)研究的人,隱身兩年後發表新模型 Jev——不會說話、不會寫程式、不會寫作文、也永遠不會說「你完全正確」。動機是 LLM 的一個致命缺陷:你叫它回 true / false,它會思考 4,000 個 token 後發明第三個選項,再收你 11 美分。Jev 的激進解法是「把語言從大型語言模型裡刪掉」,得到一種新型分類器:宣稱快 200 倍、便宜 400 倍、輸出 token 免費、零幻覺。

「200 倍快、400 倍便宜、免費輸出 token、零幻覺」這組宣稱數字是整支影片後面要檢驗的對象,畫面上的呈現方式決定了它是 benchmark 還是行銷語。
0:52 · 「200 倍快、400 倍便宜、免費輸出 token、零幻覺」這組宣稱數字是整支影片後面要檢驗的對象,畫面上的呈現方式決定了它是 benchmark 還是行銷語。
承上 用上前情提要裡的兩個背景:LLM 是自迴歸文字生成器,回答任何問題都得逐 token 生成;以及推理模型(GPT-6、Claude Fable 這類)會先產生一長串思考再作答,token 越多越貴、越慢。沒有這兩點,「不會閉嘴」與「刪掉語言」都聽不出是在解決什麼。

推理因為「AI 每週都改變世界」已經是老梗,所以作者先用反差建立這次的不同:發表者是 ChatGPT 前身 instruction-following 研究的 OpenAI 成員,兩年 stealth,而模型「不會說話、不會寫程式、不會寫作文、永遠不會說你完全正確」——把「不會做什麼」當賣點。接著點出它要解的痛點:叫 LLM 回 true / false,它會思考 4,000 個 token、發明第三個選項、再收 11 美分。Jev 的激進解法是把語言從 LLM 裡刪掉,得到一種新分類器,宣稱 200 倍快、400 倍便宜、輸出 token 免費、零幻覺。作者自己接一句「好到不像真的」,宣告本片要看三件事:程式碼、Trust-Me-Bro benchmarks、以及聲稱一年前就做過開源版的人。

AI 補充作者沒說清楚的是「刪掉語言」在技術上意味著什麼:一般 LLM 的答案是一串 token,每個 token 都要跑一次解碼,推理模型還會先吐出思考鏈;「刪掉語言」就是不再生成文字,只從固定的幾個選項裡選一個(或給一個數字),所以「輸出 token 免費」不是促銷,而是根本沒有輸出 token 可收。截圖(0:52)是 TypeSafe 自己的對照表:LLM 端到端 3–329 秒、輸入 $0.20–$10 / MTok;Jev 70ms–500ms、$0.042 / MTok,表上寫的是「40x–200x faster」,作者口頭取的是區間上限。「零幻覺」在這裡只能理解成「不會產生指定選項以外的東西」,選錯選項仍然是錯,先記著這個保留。另外 transcript 把 Jev 聽成 Jeb / Jeff,是同一個東西。

術語:instruction following

Large Language Model (LLM)

大型語言模型

以逐 token 生成文字的方式回答任何輸入的神經網路模型。

LLM 的核心機制是自迴歸:每次預測下一個 token,再把它接回輸入繼續預測,所以「回答」一定是一段文字,長度不固定。這也是它慢和貴的根源——即使問題只需要一個 bit 的答案,它仍要生成完整句子。近年的推理模型更會在作答前先生成一長串「思考」token,作者說的「思考 4,000 個 token」就是這個。

相關術語: classifier (對照組)、output tokens (計費單位)

出處:第 1 段「LLM 的致命缺陷:不會閉嘴」

classifier

分類器

把輸入對應到固定幾個類別之一的模型,輸出是標籤而不是文字。

分類器是機器學習最古老的任務型態:垃圾郵件/非垃圾郵件、貓/狗、正面/負面。它不生成任何內容,只在事先定義好的選項中挑一個,通常還附每個選項的機率。作者說 Jev 是「新型分類器」,重點在於它像 LLM 一樣讀非結構化文字,但像分類器一樣只回標籤。

相關術語: Large Language Model (LLM) (相反:不生成文字)、hallucination (結構上避免)

出處:第 1 段「LLM 的致命缺陷:不會閉嘴」

hallucination

幻覺

模型生成聽起來合理但不存在或不正確的內容。

幻覺是生成式模型特有的問題:因為輸出空間是任意文字,模型可以編出不存在的 API、論文或「第三個選項」。若輸出被限制在固定選項內,模型就無法「編」東西,這是 Jev 宣稱「零幻覺」的依據。但要注意:選錯選項不叫幻覺,卻同樣是錯的答案,所以零幻覺不等於零錯誤。

相關術語: classifier (被限制輸出後消失)

出處:第 1 段「LLM 的致命缺陷:不會閉嘴」

output tokens

輸出 token

模型生成的文字所佔的 token 數,是 API 計費中較貴的那一半。

LLM API 通常分開計價:輸入(prompt)token 便宜,輸出(completion)token 貴數倍,因為每個輸出 token 都要跑一次完整的前向運算。推理模型的思考 token 也算輸出。作者說的「11 美分」主要就是輸出 token 的錢。Jev 宣稱輸出 token 免費,等於承認它不生成文字。

相關術語: Large Language Model (LLM) (成本來源)

出處:第 1 段「LLM 的致命缺陷:不會閉嘴」

instruction following

指令遵循

讓語言模型照使用者的指令作答(而非只是接續文字)的訓練方向。

早期 GPT-3 只是「把文字接下去」,要靠提示技巧才會回答問題。OpenAI 的 InstructGPT 研究用人類示範與回饋把模型訓練成聽指令的助理,這條線後來變成 ChatGPT。作者強調 Jev 的作者出自這個團隊,是在為 Jev 的可信度背書,同時也暗示:知道怎麼讓模型聽話的人,現在反過來讓模型閉嘴。

相關術語: Large Language Model (LLM) (訓練成助理)

出處:第 1 段「LLM 的致命缺陷:不會閉嘴」

見仁見智 0:50
「200 times faster, 400 times cheaper with free output tokens and zero hallucinations」
同一畫面上 TypeSafe 自己的對照表寫的是「40x–200x faster」(70ms–500ms vs 3–329 秒),200 倍是區間上限;價格 $0.042 vs $0.20–$10 / MTok 算起來約 5–240 倍,「400 倍」要把輸出 token 免費一起算才湊得到。這些數字全是廠商自報,作者後面也自稱它們是 Trust-Me-Bro benchmarks。「零幻覺」只在「不會產生選項以外的輸出」的意義下成立,不代表選對。
依據: 影片 0:52 畫面上的 TypeSafe LLM vs Jev 對照表
留給下一段 「把語言刪掉」之後,模型到底收什麼、回什麼?作者說公司名 Typesafe AI 就是第一條線索。

2. Typesafe AI:強型別的問題與三種回傳形狀 1:19–2:01

Jev 由前 OpenAI 研究員 Diego Almeida 與他的公司 Typesafe AI 打造,剛募資 4,000 萬美元。公司名就是線索:跟一般 LLM 一樣送進問題與非結構化的 context,但它的行為更像 TypeScript 這種型別安全的語言——問題是強型別的,必須回傳指定形狀,三種之一:choice(多選一)、score(分數)、boolean(yes / no)。schema 匹配是保證的,型別錯誤在數學上不可能發生。

三種回傳形狀(choice / score / boolean)的定義畫面:這是 Jev 與 LLM 最根本的介面差異,文字描述容易漏掉每種形狀的參數。
1:52 · 三種回傳形狀(choice / score / boolean)的定義畫面:這是 Jev 與 LLM 最根本的介面差異,文字描述容易漏掉每種形狀的參數。
承上 承接上一段留下的線索——「刪掉語言後模型收什麼、回什麼,公司名 Typesafe 是提示」。這一段就是解這個提示。

推理因為上一段只講了效果沒講介面,所以作者先補來頭(前 OpenAI 研究員 Diego Almeida、公司 Typesafe AI、剛募 4,000 萬美元),再用公司名當鑰匙:輸入端跟一般 LLM 一樣,送一個問題加一堆非結構化的 context;差別在輸出端,它像 TypeScript 這種型別安全語言——你送進去的是一個「強型別的問題」,答案必須是指定形狀之一,而且只有三種:choice(多選一)、score(分數)、noul(基本上就是 yes / no)。因為輸出空間被型別限死,schema 匹配是保證的,型別錯誤在數學上不可能發生——這正是上一段「零幻覺」的來源。

AI 補充transcript 把第三種形狀聽成「a new」,截圖(1:52)的 Playground 選單寫得很清楚是 **Noul**,說明是「Evaluate how true something is」(評估某件事有多真),而 Score 是「Set up a rubric to grade with」(用評分標準打分)、Choice 是「Ask a multiple choice question」(多選一)。所以 noul 不只是布林值,它的本質是「真的程度」,這一點作者用「yes or no」帶過了。「型別錯誤在數學上不可能」的技術意思是:模型不是自由生成後再用 parser 檢查,而是只能在給定的選項集合裡做選擇,所以根本沒有「格式不對」這種輸出可以產生——跟 LLM 的 structured output / JSON mode 靠事後約束或重試是不同層次的保證。作者這裡把「一定回對形狀」講得很篤定,但還沒碰「回的內容對不對」。

術語:schema matching

type-safe

型別安全

程式(或這裡的模型輸出)在結構上不可能出現型別不符的值。

TypeScript 之於 JavaScript 就是在編譯期擋掉「把字串當數字用」這類錯誤。Typesafe AI 借這個詞說:Jev 的回答一定是你宣告的那個形狀,不會多一句解釋、不會回一段 markdown、不會發明第三個選項。要注意型別安全講的是「形狀」不是「內容」——TypeScript 也不會幫你檢查邏輯錯誤。

相關術語: schema matching (保證的結果)、hallucination (結構上排除)

出處:第 2 段「Typesafe AI:強型別的問題與三種回傳形狀」

schema matching

格式匹配

輸出完全符合事先宣告的資料結構(欄位、型別、可選值)。

一般 LLM 的 JSON mode 或 function calling 也能做到接近的效果,但做法是在解碼時用文法限制 token,或事後驗證失敗就重試。Jev 的做法是把問題本身定義成型別,輸出只能是那個型別的值,所以「匹配」不是機率很高,而是唯一可能。截圖裡 Questions 的 JSON(`isHorse: { type: "noul", instructions, criteria }`)就是這個宣告。

相關術語: type-safe (前提)

出處:第 2 段「Typesafe AI:強型別的問題與三種回傳形狀」

Noul

真值評估(Jev 的布林型別)

Jev 三種回傳形狀之一:評估某個敘述有多真,結果落在 true / false 兩個選項上。

Playground 的說明是「Evaluate how true something is」。宣告時給 instructions(問題)與 criteria(true / false 各代表什麼),模型回的是兩個選項的機率。作者說它「基本上就是 yes or no」,實際上多了一層「有多真」的程度資訊。transcript 把它聽成「a new」,是同一個字。

相關術語: Choice (兩選項的特例)、Score (對照:連續值)

出處:第 2 段「Typesafe AI:強型別的問題與三種回傳形狀」

Choice

多選一

Jev 三種回傳形狀之一:從你列出的選項中挑一個。

Playground 說明是「Ask a multiple choice question」。這是最一般化的分類形狀:分類標籤、路由到哪個工具、意圖辨識都能用它表達。Noul 可以看成只有兩個選項的 Choice。

相關術語: classifier (一種介面)

出處:第 2 段「Typesafe AI:強型別的問題與三種回傳形狀」

Score

評分

Jev 三種回傳形狀之一:依你給的 rubric 回一個分數。

Playground 說明是「Set up a rubric to grade with」。用途像 LLM-as-judge:給評分標準,讓模型對一段文字打分。跟 Choice / Noul 不同的是輸出是有序的數值,而不是無序的標籤。

相關術語: Choice (對照:有序值)

出處:第 2 段「Typesafe AI:強型別的問題與三種回傳形狀」

留給下一段 有了固定形狀的輸出,Typesafe 為什麼把 Jev 叫做「System 1 模型」?這種只會挑選項的模型,實際上能塞進什麼場景?

3. System 1 模型與便宜到能即時用的場景 2:01–3:01

Typesafe 稱 Jev 是「System 1 模型」,名稱來自 Kahneman《快思慢想》:System 1 靠直覺、快;System 2 慢而深思,像 GPT-6、Claude Fable 這類燒 40,000 token 幫變數取名的推理模型。對想在 app 裡塞便宜快速 AI 的開發者差別很大。作者用 Horse Tinder 舉例:驢子違反服務條款偷用 app,用 Jev 做審核步驟,對「is this a horse」回 boolean 就能即時封鎖。若相信這些 Trust-Me-Bro benchmarks,它比大廠模型便宜 440 倍,快到能做即時應用:遊戲 NPC 行為、世界第一個即時 AI 計算機。

Horse Tinder 審核的程式碼畫面:看到實際呼叫方式(問題 + context → boolean)才理解「型別安全的 AI 呼叫」在程式裡長什麼樣。
2:37 · Horse Tinder 審核的程式碼畫面:看到實際呼叫方式(問題 + context → boolean)才理解「型別安全的 AI 呼叫」在程式裡長什麼樣。
承上 回應上一段的問題:「只會挑選項的模型為什麼叫 System 1、能塞進什麼場景」。上一段建立的三種形狀(尤其 noul)在這段直接被拿來寫程式。

推理因為上一段把 Jev 定義成只回固定形狀的模型,所以作者接著解釋 Typesafe 給它的定位:System 1 模型,名稱來自 Kahneman《快思慢想》——System 1 快、憑直覺;System 2 慢、深思,像 GPT-6、Claude Fable 這些「老古董」推理模型,光幫一個變數取名就燒 40,000 token。這個定位對 app 開發者差別很大:作者用自家 Horse Tinder 示範,驢子違反服務條款偷用 app,於是加一個 AI 審核步驟,對「is this a horse」回一個 noul,不是馬就即時封鎖。接著把「快」推到極致:若相信那些 Trust-Me-Bro benchmarks,它比大廠模型便宜 440 倍,快到能做即時應用——遊戲 NPC 行為、世界第一個即時 AI 計算機。

AI 補充截圖(2:37)補了作者沒念出來的實際呼叫:State 欄位是非結構化的 context「a creature with 4 legs commonly called an ass」,Questions 是一段 JSON——`isHorse` 型別 `noul`、`instructions: "Is this animal a horse?"`、`criteria: { true: "yes it is horse", false: "no not a horse" }`;右側 Response 回的不是一個字,而是 **17% true / 83% false** 兩個選項的機率。這說明上一段說的「回 yes / no」其實是「回兩個選項各自的機率」,程式再依此決定封不封。System 1 / System 2 的比喻要小心:Kahneman 講的是人類的兩種思考模式,這裡只是借「快而直覺 vs 慢而推理」的對比,Jev 並沒有「直覺」,它只是不生成中間思考。作者說的「即時計算機」是玩笑——用分類器做算術正是這種模型不擅長的事。transcript 的「Conorman」= Kahneman,「TMBBBs」= Trust Me Bro Benchmarks。

術語:content moderationreal-time inference

System 1 / System 2

快思/慢想

Kahneman 對人類思考的二分:System 1 快速直覺、System 2 緩慢費力的推理。

出自《Thinking, Fast and Slow》。AI 圈借這組詞來分「直接給答案的模型」與「先推理再作答的模型」。Typesafe 把 Jev 定位為 System 1:不思考、直接從選項中選。這是行銷上的類比,不是技術規格——System 1 的人類直覺是長期經驗壓縮出來的,而 Jev 的「直覺」是訓練後的一次前向運算。

相關術語: reasoning model (對照:System 2)、classifier (System 1 的實作)

出處:第 3 段「System 1 模型與便宜到能即時用的場景」

reasoning model

推理模型

作答前先生成一長串思考 token 再給答案的 LLM。

OpenAI o 系列、GPT-6、Claude Fable 這類模型在回答前會產生「思考鏈」,對複雜問題準確率大幅提升,但每次呼叫的 token 數與延遲都暴增。作者的「燒 40,000 token 幫變數取名」是在嘲諷:對簡單問題,思考是純浪費。這正是 Jev 這種不思考模型的市場。

相關術語: System 1 / System 2 (屬於 System 2)、output tokens (思考也計費)

出處:第 3 段「System 1 模型與便宜到能即時用的場景」

content moderation

內容審核

自動判斷使用者內容或帳號是否違反規則的流程。

審核是分類器的經典用途:輸入一段文字或一個帳號描述,輸出「違規/不違規」。因為量大、要即時、每筆只需要一個標籤,用會寫作文的 LLM 來做既慢又貴。作者的 Horse Tinder 例子(判斷是不是馬)就是把審核寫成一個 noul 問題。

相關術語: Noul (用它實作)

出處:第 3 段「System 1 模型與便宜到能即時用的場景」

real-time inference

即時推論

延遲低到能放進使用者互動迴圈(幾十到幾百毫秒)裡的模型呼叫。

LLM 動輒數秒到數分鐘的回應時間只能做「送出後等」的介面;若一次呼叫壓到 70–500ms,就能放進遊戲每一幀的 NPC 決策、聊天的即時審核、輸入時的即時判斷。作者舉的 NPC 行為與「即時 AI 計算機」都是這個意思——後者是玩笑,分類器不適合算術。

相關術語: System 1 / System 2 (System 1 才做得到)

出處:第 3 段「System 1 模型與便宜到能即時用的場景」

見仁見智 2:45
「440 times cheaper than one of the big brand models」
同一支影片前面說的是 400 倍,這裡變 440 倍;依 0:52 對照表 $10 vs $0.042 / MTok 約 238 倍,要選特定最貴的模型並把輸出 token 一起算才會到 400 以上。作者自己也用「if we are to believe these Trust Me Bro Benchmarks」帶過,這是廠商自報數字。
依據: 影片 0:52 的 TypeSafe 對照表;影片 0:50 的「400 times cheaper」
留給下一段 回應裡出現了 17% / 83% 這種機率——輸出形狀保證正確,但答案本身呢?下一步要問:型別安全等於正確嗎?那個百分比可以信嗎?

4. 型別安全 ≠ 正確:校準過的信心值 3:01–3:39

輸出型別安全不代表答案正確,而且不是確定性的——同樣的問題與 context 送兩次可能得到不同結果,跟一般 LLM 一樣。為了讓你知道回答品質,每個回應附一個「calibrated confidence」數字。Chat 模型被訓練來討好人類評分者,人類愛信心,所以得到「錯得像 Kanye 一樣有自信」的模型;Jev 的信心來自 RLCD(reinforcement learning for calibrated decisions),回 60% 就代表大約六成的時候是對的。

回應裡 confidence 欄位的實際樣子:看到它是回傳 JSON 的一部分,才知道怎麼在程式裡用它設門檻。
3:34 · 回應裡 confidence 欄位的實際樣子:看到它是回傳 JSON 的一部分,才知道怎麼在程式裡用它設門檻。
承上 承接上一段的問題「型別安全等於正確嗎?回應裡的 17% / 83% 可以信嗎」。上一段的 Playground 已經讓我們看到答案是機率而不是單一標籤,這段解釋那個機率是怎麼來的、為什麼值得信。

推理因為上一段把 Jev 講得又快又便宜,所以作者馬上拆掉最容易的誤解:輸出型別安全不代表它總是正確,而且它不是確定性的——同一個問題、同一份 context 送兩次,可能得到不同結果,跟一般 LLM 一樣。那你怎麼知道這次的答案品質?每個回應附一個「calibrated confidence」數字。作者接著解釋為什麼「校準」是重點:chat 模型被訓練來討好人類評分者,而人類愛有自信的回答,所以我們得到「錯得像 Kanye 一樣有自信」的模型;Jev 的信心值則來自 RLCD(reinforcement learning for calibrated decisions),回 60% 就代表大約六成的時候是對的。

AI 補充作者跳過的一步是「校準」的定義:一個模型是校準的,意思是它說 70% 的那批答案裡,實際上大約有 70% 是對的——信心值等於命中率。一般 LLM 用 RLHF 訓練時,人類評分者傾向給篤定的回答高分,模型學會「裝有自信」,信心與正確率脫鉤,這就是作者說的 Kanye 現象。RLCD 的意思是把獎勵改成「信心值與實際對錯的一致程度」,讓模型說 60% 時真的只有六成對。這解決了上一段留下的問題:17% / 83% 不只是相對大小,而是可以直接當機率用的數字。截圖(3:34)是作者的復古風示意圖「Confidence levels and thresholds… 12 / 40 PASS」:40 個回答只有 12 個過門檻——這就是實務用法:你不是拿最高機率的選項就用,而是設一個信心門檻,過了才自動處理,沒過就退回人工或退回 System 2 模型。「60% of the time it's right every time」是 Anchorman 的哏,不是技術陳述。

deterministic

確定性

相同輸入必然得到相同輸出。

型別安全語言的函式通常是確定性的,所以「Typesafe」這個名字容易讓人以為 Jev 也是。作者特別澄清它不是:底層仍是神經網路的機率輸出,取樣、批次、硬體浮點運算都可能讓同一問題兩次答案不同。這也是為什麼要有信心值——你需要知道這一次的答案多可靠,而不是假設它固定。

相關術語: type-safe (常被混淆)、calibrated confidence (不確定時的補償)

出處:第 4 段「型別安全 ≠ 正確:校準過的信心值」

calibrated confidence

校準過的信心值

模型附在答案上的機率,其數值與實際正確率一致。

「校準」的檢驗方法是把所有回答依信心值分桶,看每桶的實際命中率是否等於該桶的信心值。校準過的 60% 就是「這類答案六成會對」,可以直接拿來設門檻、算期望成本。未校準的模型(多數 chat 模型)信心值只是「看起來的篤定程度」,沒有統計意義。上一段 Playground 的 17% / 83% 就是這個數字。

相關術語: RLCD (訓練方法)、confidence threshold (用來設門檻)

出處:第 4 段「型別安全 ≠ 正確:校準過的信心值」

RLHF

人類回饋強化學習

用人類對回答的偏好排序當獎勵訊號,訓練模型輸出人類喜歡的回答。

InstructGPT / ChatGPT 的核心訓練法(跟第 1 段的 instruction following 是同一條線)。副作用是:人類評分者偏好篤定、流暢、討好的回答,模型因此學會「有自信地錯」與「你完全正確」。作者的「trained to please human raters」講的就是 RLHF 的獎勵來源。

相關術語: RLCD (對照:獎勵不同)、instruction following (實作於)

出處:第 4 段「型別安全 ≠ 正確:校準過的信心值」

RLCD

校準決策強化學習

Typesafe 宣稱的訓練法:以「信心值與實際對錯的一致性」當獎勵,讓模型的機率可信。

Reinforcement Learning for Calibrated Decisions。跟 RLHF 的差別在獎勵函數:RLHF 獎勵「人類喜歡」,RLCD 獎勵「說 60% 就真的六成對」。影片沒給論文或細節,這是廠商自己的命名;概念上接近用 proper scoring rule(如 Brier score)當獎勵的校準訓練。

相關術語: RLHF (對照:獎勵校準)、calibrated confidence (產出)

出處:第 4 段「型別安全 ≠ 正確:校準過的信心值」

confidence threshold

信心門檻

只有信心值高於某個數值時才自動採用答案的規則。

有了校準過的機率,實務上的用法是分流:高於門檻直接處理(封鎖、路由、標記),低於門檻退回人工或交給更貴的推理模型。截圖的「12 / 40 PASS」就是這個畫面:40 個回答中 12 個過門檻。門檻怎麼設取決於錯誤的代價——誤封使用者比漏封驢子貴,門檻就要高。

相關術語: calibrated confidence (前提)、content moderation (應用於)

出處:第 4 段「型別安全 ≠ 正確:校準過的信心值」

留給下一段 信心值解決了「能不能信」,但作者還沒回答「它到底怎麼做到的」——下一個問題是 Jev 的架構是什麼,以及它是不是真的新東西。

5. 黑箱與質疑:這不就是 zero-shot 分類器? 3:39–4:22

Jev 怎麼運作沒人確定,CEO 說架構暫不公開,論文「未來可能會出」。質疑聲:有人說它跟過去的 zero-shot classifier 沒兩樣,而公司沒把功勞歸給十多年前就在做 zero-shot 分類的先驅(如 Jiny Yang);有人宣稱自己一年前發的論文跟 Jev 一模一樣;另一位開發者已做出 OpenJev——用一顆凍結的 Qwen 4B,在單次 forward pass 裡讀取各選項的機率,就重現了整個介面,不需要新訓練、一張 3090 就能跑,還有瀏覽器裡直接跑的 WebGPU demo。作者結尾:現在是當開發者的好時代。

OpenJev 的實作說明畫面:「frozen Qwen 4B、讀 option probabilities、single forward pass」是理解 Jev 可能原理的唯一技術線索。
4:15 · OpenJev 的實作說明畫面:「frozen Qwen 4B、讀 option probabilities、single forward pass」是理解 Jev 可能原理的唯一技術線索。
承上 回應上一段留下的問題:「Jev 的架構是什麼、是不是真的新東西」。前面建立的「只回選項機率、附校準信心」這個介面,是這段用來比對 OpenJev 是否重現成功的基準。

推理因為前四段都在講 Jev 做了什麼,所以作者最後問「它怎麼做到的」——答案是沒人確定:CEO 說架構暫不公開,論文「未來可能會出,也許」。既然官方沒說,作者就列出質疑:有人說它跟過去的 zero-shot classifier 沒兩樣,而公司沒把功勞歸給十多年前就在做 zero-shot 分類的先驅;有人宣稱自己一年前發的論文跟 Jev 一模一樣;最有力的是另一位開發者已做出 OpenJev——用一顆凍結的 Qwen 4B,在單次 forward pass 裡讀取各選項的機率,就重現了整個介面,不需要任何新訓練,一張 3090 就能跑,還有瀏覽器裡直接跑的 WebGPU demo。作者收尾:不管 Jev 是不是新東西,現在是當開發者的好時代。

AI 補充截圖(4:15)的 OpenJev 流程圖是全片唯一的技術線索:Unstructured state(非結構化 context)、Runtime criteria(執行期的評分標準)、Typed options(型別化的選項)三者一起餵進 4B model,模型輸出 **native option logits**,再轉成 Probabilities。翻譯成白話:把問題和選項寫成 prompt 給一個現成的 LLM,但不讓它生成——只跑一次前向運算,看它對每個選項(例如「true」「false」這幾個 token)的原生 logit 各是多少,softmax 之後就是各選項的機率。這正好對上前面看到的 17% / 83%,也解釋了為什麼「輸出 token 免費」「零幻覺」「200 倍快」:因為只有一次 forward pass、沒有解碼迴圈、輸出空間被鎖死。它也解釋了為什麼不是確定性的(logits 受批次與數值精度影響)。OpenJev 沒重現的是 RLCD 校準——凍結的 Qwen 沒經過校準訓練,它的機率是否可信是另一回事,這可能才是 Typesafe 真正的附加價值。transcript 的「zeroot」= zero-shot、「Quen」= Qwen。作者對「誰先發明」不下結論,只呈現三方說法。

術語:zero-shot classificationfrozen model

zero-shot classification

零樣本分類

不用該任務的標註資料訓練,直接用自然語言描述類別就能分類。

傳統分類器要為每個任務蒐集標註資料再訓練;zero-shot 分類把類別名稱(或描述)當輸入,用預訓練模型判斷文字跟哪個類別最相符。2010 年代就有基於語意嵌入與 NLI 的做法,LLM 出現後更直接:把選項放進 prompt 讓模型選。質疑者說 Jev 就是這個東西加上型別化的包裝。

相關術語: classifier (一種:免訓練)、Choice (介面等價)

出處:第 5 段「黑箱與質疑:這不就是 zero-shot 分類器?」

frozen model

凍結模型

權重完全不更新、直接拿來用的預訓練模型。

OpenJev 的關鍵宣稱是「no new training」:Qwen 4B 的權重原封不動,只是換一種讀取輸出的方式。這意味著 Jev 介面的「快、便宜、型別安全」全部來自推論方式而非新架構;Typesafe 若真有新東西,只可能在訓練(例如 RLCD 校準)而非介面。

相關術語: Qwen (被凍結的對象)、RLCD (對照:OpenJev 沒做)

出處:第 5 段「黑箱與質疑:這不就是 zero-shot 分類器?」

logits

原始分數

模型最後一層對每個候選 token 給的未正規化分數,softmax 後成為機率。

LLM 每一步預測其實是對整個詞彙表輸出一個 logit 向量,正常解碼是從中挑一個 token 繼續生成。OpenJev 反其道而行:不解碼,只把對應到各選項的那幾個 logit 抓出來比大小、轉機率。流程圖上的「native option logits」就是這個。這也是為什麼答案一定落在選項內——你根本沒看其他 token。

相關術語: forward pass (一次即得)、calibrated confidence (未校準的版本)

出處:第 5 段「黑箱與質疑:這不就是 zero-shot 分類器?」

forward pass

前向運算

把輸入送過神經網路一次、得到輸出(logits)的計算,不含反向傳播或多步生成。

生成一段文字要跑 N 次前向運算(每個 token 一次);分類只要一次。這是「200 倍快」最直接的技術解釋:延遲從 N 次變 1 次,且沒有推理模型的思考 token。一張 RTX 3090 能跑 4B 模型的單次前向運算,所以 OpenJev 能在消費級 GPU 上重現。

相關術語: logits (產出)、real-time inference (使之可能)

出處:第 5 段「黑箱與質疑:這不就是 zero-shot 分類器?」

Qwen

通義千問(阿里的開源模型系列)

阿里巴巴釋出的開源 LLM 系列,4B 指 40 億參數的小型版本。

Qwen 系列有多種尺寸與開放權重,是社群做實驗的常用底座。4B 這個尺寸小到一張消費級顯卡甚至瀏覽器(透過 WebGPU)都能跑。OpenJev 選它是為了證明:Jev 的介面不需要巨型模型,也不需要私有訓練。

相關術語: frozen model (OpenJev 的底座)

出處:第 5 段「黑箱與質疑:這不就是 zero-shot 分類器?」

WebGPU

瀏覽器 GPU API

讓網頁直接使用顯示卡運算的瀏覽器標準,可在瀏覽器內跑神經網路推論。

以前瀏覽器裡跑模型只能靠 WebGL 或純 CPU,WebGPU 提供接近原生的計算能力,讓 4B 級模型能在 Chrome 裡直接推論,模型權重下載到本機、不經伺服器。OpenJev 的 WebGPU demo 是在說:這個「新型分類器」連伺服器都不需要。

相關術語: forward pass (在瀏覽器執行)

出處:第 5 段「黑箱與質疑:這不就是 zero-shot 分類器?」

留給下一段 總結收束。

4. 總結

作者先用「LLM 叫它回 true / false 也會燒 4,000 token」建立痛點,Jev 的解法是把語言刪掉——不生成文字,只從固定選項選一個,所以輸出 token 免費、不會產生格式外的東西。接著用公司名 Typesafe 解釋介面:問題是強型別的,答案只能是 noul / choice / score 三種形狀,schema 匹配是保證的。這種模型被定位成 System 1(快、不生成中間思考),對 app 開發者的價值是便宜到能做即時審核與 NPC 行為;Horse Tinder 的 Playground 顯示 noul 回的其實是 17% / 83% 兩個機率。但型別安全不等於正確,也不是確定性的,所以每個回應附 calibrated confidence——由 RLCD 訓練,讓 60% 真的代表六成命中率,實務上用信心門檻決定自動處理或退回人工。最後作者問「它怎麼做到的」:官方不公開,而 OpenJev 用凍結的 Qwen 4B 單次 forward pass 讀選項 logits 就重現了介面,這既解釋了所有「快、便宜、零幻覺」的來源,也讓「Jev 是不是新東西」變成開放問題——唯一沒被重現的是校準訓練。

勘誤總整理

確定錯誤/已過時見仁見智(取決於版本或情境)

段落原話(transcript 逐字)說明
1. LLM 的致命缺陷:不會閉嘴
0:50
「200 times faster, 400 times cheaper with free output tokens and zero hallucinations」同一畫面上 TypeSafe 自己的對照表寫的是「40x–200x faster」(70ms–500ms vs 3–329 秒),200 倍是區間上限;價格 $0.042 vs $0.20–$10 / MTok 算起來約 5–240 倍,「400 倍」要把輸出 token 免費一起算才湊得到。這些數字全是廠商自報,作者後面也自稱它們是 Trust-Me-Bro benchmarks。「零幻覺」只在「不會產生選項以外的輸出」的意義下成立,不代表選對。
依據: 影片 0:52 畫面上的 TypeSafe LLM vs Jev 對照表
3. System 1 模型與便宜到能即時用的場景
2:45
「440 times cheaper than one of the big brand models」同一支影片前面說的是 400 倍,這裡變 440 倍;依 0:52 對照表 $10 vs $0.042 / MTok 約 238 倍,要選特定最貴的模型並把輸出 token 一起算才會到 400 以上。作者自己也用「if we are to believe these Trust Me Bro Benchmarks」帶過,這是廠商自報數字。
依據: 影片 0:52 的 TypeSafe 對照表;影片 0:50 的「400 times cheaper」

5. 推薦三個下一步

1. 往下挖深:zero-shot 分類與讀 logits 的原理

影片只給了 OpenJev 的流程圖;要真正理解「單次 forward pass 讀選項 logits」,得自己看一次 logits → softmax 的實作與 label word 的選法。

YouTube 搜尋:zero-shot classification LLM logits next token probabilities classification transformers OpenJev Qwen 4B

2. 往旁邊對照:模型校準與 RLHF 的過度自信

RLCD 是 Jev 唯一沒被開源重現的部分;對照 calibration 的既有研究才能判斷它是不是真的附加價值。

YouTube 搜尋:LLM calibration explained expected calibration error RLHF overconfidence calibration

3. 往上應用:用信心門檻設計 human-in-the-loop 審核流程

影片停在「設門檻」一句話;實際上門檻怎麼依錯誤代價選、沒過的怎麼退回 System 2 模型,是把 Jev 接進產品的關鍵。

YouTube 搜尋:confidence threshold human in the loop moderation LLM router fast model fallback content moderation classifier confidence

📄 全部影片 · 主題區: AI 模型與推論