Claude Fable 5 回归!高难度题目同台血战 GPT-5.5 与 Gemini
三句話摘要
測試 Claude Fable 5 模型在 Android 複雜 UI 開發上的能力,對比 Gemini 和 GPT 的表現。 Fable 5 在複雜 Android 開發任務上展現出斷層式領先,不僅代碼品質最優,更具備其他模型缺乏的前瞻性推理能力,但高昂的成本和使用限制大大降低了其實用價值。 美國政府以安全為由禁止非美國籍人士存取 Fable 5,但 Cloud 實際上難以驗證國籍身份,加上隱私限制無法收集身份證件,最終選擇對所有用戶下架模型。6月30日管制突然取消,7月1日模型重新上線,並強化安全審查機制,禁止回答涉及底層系統的所有問題。
重點整理
重點- 1
美國政府以安全為由禁止非美國籍人士存取 Fable 5,但 Cloud 實際上難以驗證國籍身份,加上隱私限制無法收集身份證件,最終選擇對所有用戶下架模型。6月30日管制突然取消,7月1日模型重新上線,並強化安全審查機制,禁止回答涉及底層系統的所有問題。
- 2
測試任務設計為 Android UI 拖拽排序功能,需實現多個複雜特性的組合:長按拖拽、邊界自動滾動、懶加載,以及流暢的動畫效果。此任務過去無 AI 模型能完成,用來評估模型真實能力的理想案例。
- 3
Fable 5 展現出顯著領先優勢,不僅完成代碼生成,更能在編譯前通過代碼分析自行發現並修正錯誤,而 Gemini 和 GPT 則依賴編譯反饋才能發現問題,這反映出推理能力的差異。
實用技巧與重點
乾貨- 測試環境:Qcode + VSCode + OpenRouter,使用 OpenAI 兼容格式,開啟最高推理強度
- 測試模型:Fable 5、Gemini 3.5 Flash、Gemini 3.1 Pro、GPT 5.5
- 下架時間:2026年6月12日(美國政府要求)
- 重新上線:2026年7月1日
- 管制取消時間:2026年6月30日
- Gemini 3.5 Flash 問題:動畫有問題、滾動速度不穩定(往上快、往下慢)
- Gemini 3.1 Pro 問題:同樣的動畫和滾動速度問題
- GPT 5.5 問題:第一列往下滑動速度異常快(能從位置100瞬間滑到位置900、1000)
- Fable 5:完美完成,動畫流暢,無滾動速度問題
結論
結論“Fable 5 在複雜 Android 開發任務上展現出斷層式領先,不僅代碼品質最優,更具備其他模型缺乏的前瞻性推理能力,但高昂的成本和使用限制大大降低了其實用價值。”
完整解析
詳細2026年6月12日,美國政府以安全理由要求 Cloud 限制非美國籍人士存取 Fable 5 模型。限制邏輯簡單粗暴——沒有美國國籍就禁止存取,但問題在於 Cloud 缺乏可靠的國籍驗證方式。由於隱私法規限制無法強制收集身份資訊,加上 OpenRouter 這類轉發服務商可輕易繞過限制,Cloud 最終決定對全體用戶下架該模型。這個決策在6月30日突然反轉,美國政府取消了管制,7月1日 Fable 5 重新上架。
值得注意的是,Cloud 用來為下架決策辯護的證據相當有力。官方測試發現 Gemini、GPT 等其他模型具備相同的安全漏洞識別能力,那麼為何只禁 Fable 5 而不禁其他?這個邏輯矛盾最終導致政府撤銷限制。重新上線後,Cloud 進一步強化了安全審查機制,底層系統相關問題一律禁答。
作者設計了一個極具挑戰性的 Android UI 任務來測試模型真實能力:實現可拖拽排序的動態清單,需支援長按拖拽、邊界自動滾動、懶加載三大功能,並保證動畫流暢。此任務過去無任何 AI 模型完成過,是檢驗推理和編碼能力的理想基準。
測試結果顯著:Fable 5 首次嘗試就完美完成,長按拖拽、邊界滾動、動畫都無瑕疵。Gemini 3.5 Flash 和 3.1 Pro 都遇到相同問題——動畫卡頓、滾動速度不一致(往上快往下慢),這曾是 Gemini 3.1 時代的典型漏洞,如今竟然還存在。GPT 5.5 表現次於 Fable 但優於 Gemini,能完成基本功能但在第一列往下滑動時出現超快速 bug(瞬間從100滑至900+)。最令人印象深刻的是,Fable 5 能在編譯前通過代碼分析自行發現錯誤並修正,而 GPT 和 Gemini 必須依賴編譯反饋才能調試——這反映出不同模型的推理深度。作者再次要求 Fable 5 重新實現同一任務以驗證首次成功非運氣,結果依舊完美無缺,進一步確認了其能力優勢。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


