0124GitHub
Jev Capability Atlas
Where Jev holds up and where it breaks, with real API receipts.
Zaious/jev-capability-atlasREADME ↗
🇹🇼 中文(本頁)|🇬🇧 [English](README.en.md) # Jev Capability Atlas **獨立、非官方、非 TypeSafe 贊助的社群專案。** 這個 repo 存在的目的,是幫你、我、還有任何想用 [Jev](https://typesafe.ai)(TypeSafe 的 System One 模型)的人,**正確識別手上的任務適不適合交給它**——用真實 API 呼叫的收據,畫出它「校準決策」這個宣稱在哪裡站得住、在哪裡站不住的邊界地圖。給人看怎麼用,給 agent 帶進專案看哪裡能試著換上去,也給任何做過真實驗的人一個把結果貢獻進來的地方。 不是排行榜(市面上已經有 [jev-benchmarks](https://github.com/AbdelStark/jev-benchmarks)、[thaiexam-jev-charts](https://github.com/vehas/thaiexam-jev-charts) 在做這件事,做得很紮實,我們引用它們、不重做)。這裡要回答的是更根本的問題:**什麼情況下它強,什麼情況下它弱,為什麼**。 ## 30 秒版 **先講它是什麼**:Jev 適用的情境很「橫切」(cross-cutting)——不是侷限在少數幾個產業,是任何系統裡「窄判斷」這一層,不管屬於瀏覽器自動化、程式碼審查、內容審核、金融交易、新聞分類、電玩,都用得上,見 [`capability-map.md`](capability-map.md) 收錄的十幾種完全不相干的產業案例。💭 它本身內建的世界知識有限,但只要資訊在你餵給它的 `state` 裡給得夠齊,閱讀理解/擷取能力好到誇張——這是我們累積幾十個真實案例(🔬 自己測的、📚 第三方跑分)後歸納出的核心特徵,細節見下面「核心發現:一條軸」。 **機制上**:它很快、很便宜,只能做「選一個選項/打個分/回答是非」這種窄判斷,不會寫文字解釋自己在想什麼。因為答案空間是你自己先定義好的,它**結構上不可能吐出選項清單以外的東西**——這跟自由生成文字的模型偶爾格式跑掉、甚至生出一個你沒列的分類,是不同等級的保證,不是機率低,是型別上不可能(但這只保證答案落在清單裡,不保證選到的那個是對的,細節見下面「不是瞎猜」那節)。 **它在「答案就寫在你餵給它的文字裡」的任務上很準**(分類、判斷兩段文字關不關聯、抓語意層的矛盾),也適合把「候選項雖多但內容都給齊」的操作一次批次問完——例如瀏覽器自動化裡「畫面上這些元素該點哪個」,見下面案例。**反過來,它的判斷完全建立在你給的文字上——文字有錯時,它不會提醒你題目怪怪的,照樣很有把握地選**。🔬 我們自己踩過一次:一道歷史選擇題的正確選項被我們打錯一個字,它以 0.90 的信心選了錯的答案;只修正錯字重問,它就不再選那個錯的(見 [`suites/history-recall-context/`](suites/history-recall-context/);這個錯是讀者在 [issue #2](https://github.com/Zaious/jev-capability-atlas/issues/2) 抓到的,這一段的舊版也因此更正)。**需要你沒給它的外部知識時,它知不知道你事前看不出來**——📚 第三方真實案例裡,它在文章沒寫的背景關聯上比大模型弱(見 [`translations/libukai-hubei-news-classification-zh/`](translations/libukai-hubei-news-classification-zh/)),🔬 但我們自己的冷門史實題它不給背景也以 0.87 的信心答對。需要的資料放進 `state` 最保險。 --- ## 它不是狀態機,也不是瞎猜——但也不是「會思考」的推理模型 看到上面「只能做窄判斷、不解釋自己」,很容易腦補成「它就是個狀態機/查表機」或「它在瞎猜」——兩者都不對,錯的方向還不一樣。 這個比喻不是空穴來風:「語意層的窄判斷」這個架構位置,過去一年通常是規則狀態機+反應快的小模型在填,代價是死板、能力上限低。Jev 想填的正是同一個位置,但底層換成真正的