Jev 不寫文章、不寫摘要、不回你半句話。你給它一段文字和一組自己定義的選項,它只做一件事:挑一個,並告訴你每個選項它給幾成把握。軟體裡那些「這封信該轉給誰」「這則新聞算哪一類」的判斷,以前要寫一長串規則再永遠補例外,現在可以整段交給它。對寫程式的人來說,差別是問題和答案都變成結構化欄位:不用寫 prompt,不用解析回傳文字,回來的值在型別上不可能是你沒定義過的東西。
我們拿到帳號後實際上手,用日報管線的真實資料跑了三個情境——新聞分類、社群選題、讀者來信路由——也故意問了幾個它做不到的事。
為什麼寫程式的人會想試它
它是那個你一直寫不出來的 if。 這一輪有一封擬真投訴信:「你們昨天那篇報導引用了我公司的產品資料但完全沒有註明出處……否則我方將交由法務處理。」信裡有「報導」「描述有誤導」,關鍵字規則會把它丟進「內容更正」,自動回一封「感謝指正」。Jev 給的是 需要人工 0.93 / 內容更正 0.07。
沒有文字要解析。 我們管線裡有一份 INVALID_PATTERNS 黑名單(daily_qa.py:16),專攔模型輸出裡的 think 標籤殘留、「作為 AI」角色宣告、Markdown 標題、JSON code fence,是被現實一條條逼出來的。Jev 這邊,問題是 questions / criteria 欄位,答案是 choice / confidence / probabilities 欄位。
輸出一定落在你給的選項裡。 我只給一個選項「新聞」,它回 新聞 1.00;只給蘋果/香蕉/芒果,它照樣只在裡面挑。下游不必寫「萬一它回了奇怪的東西」。
便宜到每一筆都可以跑。 官方數字是輸入每百萬 token 0.042 美元、輸出免費、端到端 70–500 毫秒,官方對照以 GPT-6 Astra 與 Fable 5.1 的平均為基準、宣稱快 193.6 倍(皆官方自測)。以前做分類要省錢,只跑值得跑的那幾筆;這次三個情境是同一個 API、每一筆都跑。
情境 A:新聞分類——它把猶豫攤開給你看
18 則 9 月 15、16 日的真實新聞,標題加摘要,一題九選一;分類定義逐字取自 process_with_haiku.py:320-328,就是我們現在在用的那份。
判得乾脆的長這樣:「OpenAI 以 3 億美元收購智慧手機相機製造商 Glass Imaging」→ business 1.00,其餘八類全部 0.00。猶豫的是「時尚應用 Daydream 利用 Apple Intelligence 將相機膠卷中的穿搭變成可購物內容」→ consumer 0.65 / product 0.33,confidence 0.61:這則同時是「一般人用得到的應用」和「新功能上線」。更極端的是「使用 GPT-Live-1 打造更自然的語音體驗」→ product 0.51 / devtools 0.49,confidence 0.44;我們管線標 product,它也選 product,只多贏 0.02。它在猶豫,跟它答錯,是兩件事。
拿 0.65 那種數字當閘門:高的自動入庫,低的排人工複檢。這一輪也有我們和它標得不一樣的題目。回頭看,卡住的是我們自己的分類定義:硬體新品算 product 還是 consumer,那份定義沒講。
情境 B:社群選題——一次問兩個軸
同一批 18 則,一次呼叫問兩題:適不適合寫成面向一般讀者的 Threads 貼文?讀者看完今天能不能動手?回來是兩個獨立的機率分布。
「OpenArch – PyTorch 實作的現代 LLM 架構」→ 第一題 不適合 1.00 / 適合 0.00;第二題它選「純資訊」,但「可動手」仍拿到 0.40、confidence 只有 0.21:懂的人是真的能拿去跑,它沒把這件事一起否定掉。
猶豫的仍是那則 GPT-Live-1 語音體驗 → 適合 0.59 / 不適合 0.41,confidence 0.18;第二題 可動手 0.25。情境 A 的分類題上,它最猶豫的也是這一則。
用法是把軸拆開問。「免費 AI Agent 模型怎麼用?……免費 API KEY 完整攻略」那則 不適合做 Threads 0.99、但 可動手 1.00:有具體申請步驟,今天就能動手,題材卻太窄。兩件事擠成一個綜合分數,它就卡在中間值。
覺得有用?每天 5 分鐘掌握 AI 新工具
免費訂閱,新工具搶先看,隨時可取消
情境 C:讀者來信路由——猶豫的方向本身有資訊
15 封自己寫的擬真來信(沒有用任何真實訂閱者的信件),一題五選一:訂閱問題/內容更正/合作邀約/垃圾/需要人工。
一封寫「內文寫『iOS 27 於九月正式推送給所有機型』,但官方公告寫的是分批推送」→ 內容更正 1.00;前面那封帶法律威脅的投訴信 → 需要人工 0.93。兩封都在說「你們寫錯了」,它把法律威脅當成不能自動回的訊號。
我故意寫了一封混兩件事的信——問能不能把新聞資料以 API 授權,順便說信箱要換 → 需要人工 0.80 / 合作邀約 0.16 / 訂閱問題 0.04,第二、三名剛好是這封信真正混在一起的那兩類。唯一一封英文的遺產詐騙信 → 垃圾 0.95 / 需要人工 0.05。這情境最容易接上自動化:高信心的自動走既有流程,低信心的連同分布丟人工佇列。
它做不到的
不能生成文字,是 API 層級的硬拒絕。 我問它「幫這則新聞寫一句 Threads 開場白」,題型填 "type": "text",拿到 HTTP 422:
"msg":"Input tag 'text' found using 'type' does not match any of the expected tags: <QuestionType.Noul: 'noul'>, <QuestionType.Choice: 'choice'>, <QuestionType.Score: 'score'>, <QuestionType.BoundingBox: 'bounding_box'>"
把 type 整個拿掉也一樣被擋(union_tag_not_found)。四種題型沒有一種會吐自由文字,要寫任何一句人話還是得用生成模型。
選項裡沒有正確答案時,它還是會選一個。 我拿一則新聞問「這段文字在講哪一種水果?」,選項只給蘋果/香蕉/芒果,它回 蘋果 0.55 / 芒果 0.27 / 香蕉 0.18,confidence 0.33。它不會說「都不是」——「其他/無法判斷」必須你自己放進去,不放它就在錯的選項裡分配機率。
需要站外事實的題目,它可能高信心地答錯。 我給它一句「內文寫『iOS 27 於九月正式推送給所有機型』」,問這句跟 Apple 官方公告相不相符,選項給了相符/不符/無法判斷,它回 不符 0.98 / 無法判斷 0.02,confidence 0.97。逃生口我放了,它沒用;光看那一句話沒人能確認官方公告寫什麼,正確答案應該是「無法判斷」。它判斷的是眼前這段文字,不是這段文字對不對——而這類失誤不會表現成低 confidence,你沒有訊號可以攔。
機率小數會擺動,選項是穩的。 同一批信前後跑兩次,那封混兩件事的信一次 0.80 / 0.16 / 0.04、一次 0.76 / 0.20 / 0.04,投訴信是 0.93 和 0.94,選的類別都沒變——門檻別卡在精確值上。另外 confidence 跟最高機率不是同一個數字:適合 0.59 那題 confidence 只有 0.18。
怎麼開始
等候名單制,到 TypeSafe 官網申請 early access。端點 POST https://api.typesafe.ai/v1/systemone,帶 Authorization: Bearer 你的 key。情境 A 的請求長這樣(criteria 實際給九類,這裡只列兩類):
{"model":"jev-latest","state":"標題:OpenAI 以 3 億美元收購智慧手機相機製造商 Glass Imaging\n摘要:……","questions":{"category":{"type":"choice","instructions":"這則 AI 新聞屬於哪一個分類?","criteria":{"business":"企業/商業(融資、併購、策略轉型、企業級應用)","product":"產品發佈/更新(新功能、新工具上線,人人可用的)"}}}}
回來的長這樣(同樣只列兩類):
{"answers":{"category":{"type":"choice","choice":"business","confidence":1.0,"probabilities":{"business":1.0,"product":0.0}}}}
state 是要判斷的文字,questions 每個 key 是一題(可一次多題,情境 B 就是),criteria 的 key 是選項名稱、value 是定義,「其他」要你自己記得放。回來的 choice 保證是你給過的 key,probabilities 是全部選項的機率,confidence 是另一個獨立數字;回應另帶 usage,輸出 token 照官方說法免費。
FAQ
它可以取代我現在用來做分類的 LLM 嗎?
看那支 LLM 在做什麼。只是「讀一段文字、選一個標籤」的話形狀對得上,prompt、JSON 解析、格式防禦可以整層拿掉。如果它同時還在寫摘要、寫標題,那部分 Jev 接不了。
confidence 多少以上才能自動處理?
門檻得在你自己的資料上訂,而且看整個分布比看單一數字有用。它猶豫時,第二名往往就是那題真正的另一個答案(像那封混了合作邀約和換信箱的信)。
「不會幻覺」是真的嗎?
它保證的是型別合法——回來的一定是你定義過的選項,連只給三個水果選項時也照樣只在裡面挑。但型別合法不等於內容正確:iOS 27 那題,它以 0.98 的機率答了一個自己無從驗證的問題。
這篇不是評測:我們沒做對照實驗,也沒拿其他模型跑同一批題目,寫的只是我們丟了什麼進去、它回了什麼。想先搞清楚 Jev 是什麼、官方數字怎麼來,看前一篇整理:TypeSafe Jev:官方稱比 GPT-6 Astra 便宜近 200 倍、最快 70 毫秒回答的「只做判斷」AI。
常見問題 FAQ
它可以取代我現在用來做分類的 LLM 嗎?▼
confidence 多少以上才能自動處理?▼
「不會幻覺」是真的嗎?▼
相關日報
喜歡這篇?每天早晨還有更多。
訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。
延伸閱讀
TypeSafe Jev:官方稱比 GPT-6 Astra 便宜近 200 倍、最快 70 毫秒回答的「只做判斷」AI,小團隊拿它做分類、路由、評分
TypeSafe 推出的 Jev 不寫文章,只從你定義的選項裡挑答案:官方數字輸入每百萬 token 0.042 美元、輸出免費、70–500 毫秒回應,對照 GPT-6 Astra 便宜 193.6 倍。我們核對官方 blog 與文件,講清楚它能做什麼、不能做什麼、「不會幻覺」的真正意思,以及小團隊怎麼用。
Anthropic Claude 生態Anthropic Claude 生態系全景圖:從 API 到 Agent SDK 完整路線圖
深入解析 Anthropic Claude 生態系,涵蓋 Claude API 使用指南、Anthropic 產品線佈局及 AI 開發者資源,助您掌握從基礎整合到 Agent SDK 開發的完整路線圖。
Claude 4.7 OpusClaude 4.7 Opus 實戰:1M 上下文與 Prompt Caching 完整教學
深入解析 Claude 4.7 Opus 實戰應用,掌握 1M 上下文處理與 Prompt Caching 技術。本文提供完整 Claude 教學,幫助您提升 AI 效率與成本效益。
claude 4.8 opusClaude 4.8 Opus 實戰:1M 上下文與 Prompt Caching 高效教學
深入解析 Claude 4.8 Opus 實戰應用,掌握 1M 上下文處理與 Prompt Caching 技術。本文提供完整 Claude 教學,幫助您提升 AI 效率與成本效益。
🤖 本指南由 AI 整理,功能、價格與規格請以官方網站為準。如有疑慮,請參閱編輯政策。
