AI最強模型Fable 5值得試嗎?強到被禁用、一句"Hey"燒20美元!最強AI不等於最好用?|Kelly Tsai
學習筆記
TL;DR
FableFive 是一款專為工程長線任務設計的強大 AI 模型,能自主管理複雜專案並避免錯誤累積,但其高昂的費用、潛在的隱藏成本與操作限制,使其僅在特定大規模、高風險且無法容忍失敗的任務中才具備成本效益;對一般任務而言,搭配便宜模型的「指揮官加工人」策略或直接使用便宜模型會是更划算的選擇。
快速結論
FableFive 在處理複雜、多步驟的「工程長線任務」上表現卓越,如大規模程式碼重構或需數小時自主執行的專案。它能像資深架構師一樣自主拆解任務、修改計畫並進行測試,有效避免了普通模型在長流程中容易「飄掉」(Drift)導致錯誤累積的問題。然而,其高昂的費用(token 費率是 GPT-4.8 的兩倍,Sonic 的五倍)與隱藏成本(如快取失效導致的「愚蠢稅」、背景探索助手費用)是主要考量。
此外,FableFive 雖然強大,但也存在一些限制,如處理簡單任務時可能過度思考、速度較慢,甚至在碰到敏感詞時會悄悄降級由舊模型回答。因此,FableFive 的價值體現在它能一次性成功解決其他模型需要多次嘗試才能完成的困難任務,從而省下因失敗重試而耗費的時間與成本。
對於不需極致智能的即時互動、日常任務或常觸及敏感詞的專案,使用便宜的模型更為合適。社群也發展出「指揮官加工人」模式,讓 FableFive 負責高階決策與把關,便宜模型處理重複性「苦力」工作,此策略能在大幅節省成本的同時維持接近 FableFive 的高表現,但前提是任務能被乾淨地拆分,且需留意重複讀取背景資料、指揮官搶工或背景助手造成的隱藏開銷。
這支影片在說什麼
這支影片深入探討了 AI 圈當紅模型 FableFive 的實用性與成本效益。影片旨在分析 FableFive 強大的功能,與其他模型的差異,並討論在何種情境下其高昂的費用是值得投入的。同時,影片也介紹了如何透過「Prompting 加上便宜模型」的策略來逼近 FableFive 的效果,以幫助觀眾在理解模型能力與成本後,能更明智地選擇合適的 AI 工具。
最重要的 3-5 個重點
- FableFive 的核心優勢在於處理「工程長線任務」: 它能像資深架構師或施工隊長一樣,自主理解模糊目標、拆解任務、改計畫、跑測試,並在長對話中維持上下文記憶,避免一般模型常見的「飄掉」(Drift)問題。這使其在 Sweetbench Pro 等測試中表現優異。
- FableFive 伴隨高昂費用及多重隱藏成本: 其輸入/輸出 token 費率遠高於其他模型。此外,還有因快取失效導致重新載入對話歷史而產生的「愚蠢稅」,以及預設啟用、在背景偷偷燒錢的探索小助手等隱藏開銷,可能使總體花費遠超預期。
- FableFive 存在操作限制,不適用於所有情境: 它速度較慢(吐出第一個字可能需 19 秒),在處理簡單任務時可能因過度思考而卡住或效率低下。更甚者,遇到資安或生物相關敏感內容時,系統會「偷偷換人」由較舊的 GPT-4.8 回答,用戶卻仍在支付 FableFive 的費用。
- 選擇 FableFive 的關鍵在於任務的規模、複雜度與失敗成本: 只有當任務規模龐大、需長時間自主執行、不能出錯(高風險商業邏輯),且便宜模型反覆失敗導致的重試成本更高時,FableFive 才值得投入。對於即時互動、日常自動補齊摘要或常觸及敏感詞的任務,則應避免使用。
- 「指揮官加工人」模式可大幅降低成本: 透過讓 FableFive 擔任指揮官(負責高階判斷、任務拆解、把關),將大部分執行性的「苦力」任務交由便宜模型(如 Claude-Sonic, GPT-4.8)處理,可以在保留高效率的同時,顯著降低總體成本。然而,此模式需任務能被乾淨拆分,且需注意便宜模型重複讀取背景資料的潛在成本,以及指揮官搶工的問題。
知識架構
一、FableFive 簡介與核心優勢
- 定位: 資深架構師 / 專案施工隊長,能自主抗完整個專案。
- 差異: 與一般 AI (聊天助手、一步步指引) 不同,FableFive 可接受模糊大目標,自主拆解、改計畫、跑測試。
- 關鍵能力:
-
「長距離」多步驟任務處理:* 在長篇上下文記憶中,記得前面做過什麼決定,稱得住長跑。 * 避免 Drift (飄掉): 克服普通模型中間一步錯,後續如滾雪球般越錯越多的現象。
- 效能實測:
- Sweetbench Pro (修真實開源專案 bug): FableFive 80.3%,第二名 [待確認資訊] Oper 4.8 90.2%,GPT5.5% [待確認資訊] 58.6%。
- 演算法測驗: FableFive 29.3%,GPT5.5% [待確認資訊] 5.7%。
- 限制: 非所有項目都是第一名 (如博士級科學推論),是工程長線任務的王者,但非全能冠軍。
二、FableFive 的潛在問題與缺點
- 高昂費用:
- Token 費率: 輸入每百萬 token 10 美金,輸出 50 美金 (GPT-4.8 的 2 倍,Sonic 的 5 倍)。
- 愚蠢稅 (Stupidity Tax): Prompt cache 約 5 分鐘失效,重載龐大對話歷史導致高額費用。
- 背景探索小助手: 預設開啟,以 FableFive 費率在背景搜檔案,產生隱藏費用。
- 過度思考與卡住:
- 原因: 強項來自深度思考。
- 影響: 簡單任務若開最高思考模式,易鑽牛角尖、反覆懷疑,甚至卡死,浪費費用與時間。
- 速度慢與「偷偷換人」:
- 速度: 最高思考模式下,吐第一個字可能需 19 秒。
- 換人: 內建嚴格安全審查,敏感內容 (資安、生物) 會轉給較舊的 GPT-4.8 回答,但仍收取 FableFive 費用。
三、FableFive 的適用情境
- 值得使用:
- 規模大、耗時長任務: 跨數十個檔案的大重構、需跑數小時的長線任務。
- 高風險、不能出錯的商業邏輯: 需要一次到位,失敗成本高。
- 不值得使用:
- 即時互動介面: 因速度慢。
- 日常自動補齊、摘要: 「拿火箭筒打小鳥」。
- 常碰敏感詞的專案: 容易被降級,不如直接用便宜模型。
四、省錢策略:指揮官加工人模式
- 概念: 讓貴的 FableFive 當「指揮官」 (看懂需求、拆解任務、把關),便宜模型 (如 Sonic) 當「工人」 (跑測試、重構等苦力)。
- 實測效果:
- Browse Comp 測驗:46% 成本達成 96% FableFive 效果 (砍掉一半錢,掉 4% 表現)。
- XDA 作者:GPT-4.8 + Ralf Loop 外掛重現 FableFive 約 80% 自主能力,成本減半。
- 背後原因: 大部分 token 花費在不需要頂級智力的攪拌、跑測試、搬動等,便宜模型能做好。
- 潛在問題與限制:
- 重複讀取上架文件: 便宜工人模型每接任務都需重新讀取背景資料,可能導致成本翻倍。
- 指揮官搶工: 若沒有綁死,貴的指揮官可能自己下來寫程式碼,輸出暴增。
- 任務拆分: 關鍵在於任務能否被「乾淨地」拆開,讓 FableFive 專注關鍵判斷,工人可各自非同步跑。
- 便宜模型判斷力: 若將判斷事情 (如讀一大段文字找出重點) 交給便宜模型,容易抓錯重點,後續決策錯誤,最終花更多錢收拾。
關鍵概念
- FableFive: 一款被描述為「資深架構師」或「施工隊長」的 AI 模型,擅長自主管理複雜、多步驟的長線工程任務。
- Drift (飄掉): 普通 AI 模型在長對話或多步驟任務中,因中間一步出錯而導致後續錯誤像滾雪球一樣擴大,最終整個垮掉的現象。FableFive 能有效避免。
- Prompt cache (快取): 系
統為節省每次對話重新載入歷史記錄的費用而暫存的對話歷史。FableFive 的快取時效約 5 分鐘。
- 愚蠢稅 (Stupidity Tax): 社群對 FableFive 因 Prompt cache 失效而重新載入龐大對話歷史所產生的高額費用的稱呼。
- 指揮官加工人模式 (Commander-Worker Architecture): 一種 AI 應用策略,讓貴的 AI 模型(如 FableFive)扮演指揮官,負責高階判斷與任務拆解;讓便宜的 AI 模型(如 Claude-Sonic)扮演工人,負責執行具體、重複性的「苦力」任務。
- Sweetbench Pro: 一個業界常用的測試,透過給予真實的開源專案 bug 讓模型去修復,以評估其在工程長線任務上的能力。
重要例子與細節
- FableFive 能力與效率:
- 一天之內將一個 5 千萬行的城市碼庫搬到新的架構,人類工程團隊原本需兩個多月。
- 在 Sweetbench Pro 測驗中,FableFive 拿到 80.3% 的分數。
- 在測驗演算法的題目中,FableFive 拿到 29.3%。
- FableFive 費用與隱藏成本:
- FableFive 輸入每 100 萬個 token 收 10 塊美金,輸出收 50 塊美金。這個價格是 Oper 4.8 的兩倍,Sonic 的五倍。
- 社群有人貼出帳單截圖,因離開超過 5 分鐘導致快取失效,一句簡單的 "Hey" 就燒掉 20 塊美金。
- Amplify 超級使用者一天燒超過 50 塊美金,公司整套部署下來平均一個月要 155 到 250 塊美金(換算台幣約 5 千到 8 千)。
- FableFive 缺陷與限制:
- 在 Cursor 編輯器的論壇上,多數人回報選用 FableFive 高思考模式後,常在超級簡單的終端機指令上卡住,且每秒都在燒 API 費用。
- 當思考程度開到最高時,FableFive 吐出第一個字可能要等 19 秒,但對應的中間燒錢只需 1.4 秒。
- 內建嚴格的安全審查,碰到資安、生物相關敏感詞,不會直接拒絕,而是偷偷轉給較舊的 Oper 4.8 回答。曾有使用者改帶科技術語的履歷就被降級。
- 成本效益評估範例:
- 一位開發者做重構任務,Oper 4.8 嘗試三次才成功,燒掉約 60 萬輸出 token,花費約 15 美金。FableFive 一次成功,只用 13 萬 token,花 6.5 美金。在難任務上,貴的反而便宜。
- 指揮官加工人模式實測:
- 在 Browse Comp 測驗上,指揮官加工人模式只花費 46% 的成本,就做到了全程用 FableFive 的 96% 效果。
- XDA 科技媒體作者使用 Oper 4.8 加上 Ralf Loop 外掛,重現了 FableFive 約 80% 的自主能力,成本是 FableFive 的一半。
- 開發者進行 AB Test,發現將大任務發包給便宜的 Sonic 後,因 91% 的成本花在重複讀取上架文件,總成本反而貴了一倍以上。
- 若指揮官沒有被綁死,它會忍不住自己下來寫程式碼,結果輸出暴增 74%。
可學習的洞察
- 策略性選用 AI 工具而非盲目追逐最強: 最強大的 AI 模型不等於最好用或最划算。應著重理解手頭任務的特性與需求,精準匹配最合適的工具,而非盲目追逐當下最新的模型。
- 全面評估 AI 成本,考慮隱藏費用與失敗重試: 評估 AI 模型的成本不應只看單次 token 費率,而需將任務的複雜度、成功率、失敗重試所需的費用、時間投入及人力成本一併納入考量。影片中「愚蠢稅」和背景助手的例子,提醒我們警惕隱藏開銷。
- 理解 AI 的「思考深度」是一把雙面刃: FableFive 的強大來自於深度思考能力,但在簡單任務上,這種能力反而可能導致過度思考、效率低下甚至卡住。這提醒我們應根據任
務難度,調整 AI 的「思考模式」或選擇更輕量的模型。 4. 模組化與任務拆解是優化 AI 應用的關鍵: 「指揮官加工人」模式的成功在於將任務「乾淨地」拆分成高階判斷與低階執行。這種模組化思維不僅適用於 AI 應用,也是一般專案管理中提升效率和降低成本的重要方法論。
可行動的整理
- 評估 AI 任務類型: 在考慮使用高階 AI 模型(如 FableFive)前,先判斷手邊任務是否屬於「大規模、耗時長」或「高風險、不能出錯」的工程長線任務。
- 檢視現有 AI 部署成本: 定期檢查 AI 工具的實際花費,特別留意是否有類似 FableFive「背景探索小助手」的隱藏費用,並手動綁定便宜模型以節省開銷。
- 嘗試「指揮官加工人」模式: 若手邊任務可被乾淨拆分,考慮採用此模式,讓高階模型負責決策,低階模型負責執行,以優化成本效益。
- 研究模型特性與費率: 深入了解 FableFive、GPT-4.8、Claude-Sonic 等不同模型的 token 費率、優勢與限制,以便更精準地選擇工具。
- [待研究] 任務「乾淨拆分」的具體方法論: 如何有效地將一個複雜任務拆解成高階判斷與低階執行,以最大化「指揮官加工人」模式的效益。
- [待研究] 如何「綁死」指揮官模型,避免其搶工人的工作: 探索 Prompt 設計或系統設定上,避免高階模型介入低階執行任務的方法。
複習問題
- FableFive 的核心優勢是什麼?它在哪些類型的任務中表現突出?
- 除了高昂的 token 費用外,FableFive 還可能產生哪些「意外花費」或隱藏成本?請舉例說明。
- 為什麼 FableFive 不適合用於即時互動或日常自動補齊/摘要的任務?
- 解釋「指揮官加工人」模式的運作原理,並說明其在什麼情況下能有效節省成本,又在什麼情況下可能產生反效果?
- 在使用高階 AI 模型時,除了直接的費用,我們還需要考量哪些更全面的成本因素?
待確認資訊
- Sweetbench Pro 測試排名與分數: 逐字稿中提到「FableFive 拿到80.3% 第二名的Oper 4.890.2%」,語句上暗示 FableFive 不會是第一名,但同時給出 Oper 4.8 的分數 90.2% 高於 FableFive。需要回看影片確認此處的語意,即誰是第一名或第二名,以及數字的準確性。
- 「GPT5.5%」: 逐字稿中多次出現「GPT5.5%」,從上下文判斷,這極可能是「GPT-3.5」的口誤或轉錄錯誤。影片中提及的應該是 GPT-3.5。