KeyFrame內部研究專用

Anthropic 工程師為什麼拋棄 Markdown 改用 HTML 跟 AI 工作?

Gary Chen·5月21日週四·13 min中文

三句話摘要

AI時代真正的瓶頸:從產出變便宜到理解變昂貴,以及如何用更好的格式來倖存。 AI時代你的價值不是「能快速產出東西」,而是「能做出判斷並證明自己理解了所交付的東西」。 工作量悖論——AI讓產出變快,組織標準就跟著水漲船高。以前一週交一份報告,現在每天一份。任務擴張、工作邊界模糊、多工處理成為常態,表面提升效率卻導致認知疲勞。

重點整理

重點
  • 1

    工作量悖論——AI讓產出變快,組織標準就跟著水漲船高。以前一週交一份報告,現在每天一份。任務擴張、工作邊界模糊、多工處理成為常態,表面提升效率卻導致認知疲勞。

  • 2

    審核成本才是真正瓶頸——過去稀缺的是「誰來做」,現在稀缺的是「誰來看、誰來判斷」。每個AI產出都需要人重新讀、重新理解、重新判斷,決策疲勞無法量化,上級看不見,系統不會記錄,最後變成個人累成狗。

  • 3

    理解與品味成為真正資產——AI壓低了產出成本,能力證明從「能不能做出來」變成「有沒有真搞懂」。深度理解才能長出品味和判斷力,這是任何技術浪潮都沖不走的東西;而透過逼迫自己搞懂每個細節,才能建立真正的專業能力。

  • 4

    格式決定效率——人與AI之間的交互介面至關重要。Markdown對文字友善,但超過100行就難以理解;HTML能放圖、表格、互動,讓複雜資訊變成一眼能懂、拖拽能決定的工作頁,大幅降低審核成本。

實用技巧與重點

乾貨
  • 研究數據:
  • 哈佛商業評論:美國200人科技公司,8個月追蹤,40多場訪談
  • 三層工作影響:
  • Task expansion — 產品經理開始寫code、marketing開始做設計
  • 工作邊界模糊 — 「反正只是一句話」的提示詞逐漸侵蝕非工作時間
  • 多工處理增加 — 邊做自己的事邊讓AI跑、邊等agent邊開新session
  • 關鍵系統案例:
  • Claude Code — 記憶系統用Markdown;MEMORY檔 + 日期命名的markdown檔存長期記憶
  • OpenClaw — 開源圈衝上來的agentic系統,記憶底層也全是markdown檔
  • Anthropic工程師Thariq的觀點:
  • 文章標題:「The Unreasonable Effectiveness of HTML」
  • 核心論點:超過100行的markdown自己就讀不下去了
  • HTML三種使用場景:
  • 拿來比較 — 一頁並排六個設計版本,每個標清楚取捨,而非文字描述
  • 拿來理解 — 一頁explainer + 流程圖 + 常見坑的專區 + 十題選擇題驗證理解
  • 拿來決策 — 可拖拽的Jira卡片網頁,分優先序等欄位,審核後自動轉成prompt回傳
  • 能力證明的核心四問(作者Patreon文章分享):
  • 你做的東西是什麼?
  • 你為什麼選擇這個做法?
  • 這個東西在什麼情況下會壞掉?
  • 你在這次實作中學到了什麼?

結論

結論

AI時代你的價值不是「能快速產出東西」,而是「能做出判斷並證明自己理解了所交付的東西」。

完整解析

詳細

今年二月哈佛商業評論發表了一項讓人意外的研究。研究員花八個月追蹤一家200人的美國科技公司,進行40多場訪談,結果發現AI不僅沒有幫人省事,反而讓人更累了。工作量變多、步調變快,甚至原本的空檔時間也被塞進各種事情。這波生產力爆衝最後換來的是壓力堆積、認知疲勞、品質下滑、決策變差,最終導致burnout和離職。

這個現象不是孤立的技術問題,而是深層的社會經濟循環。農業時代一個農夫一天能耕多少地就是極限;工業革命後產能翻倍,農夫要顧的機器、規劃的範圍、要收的東西也跟著翻倍。AI完全複製了這個模式:它讓產出變容易,所以大家的標準就水漲船高。以前一週交一份報告,現在每天都要一份。講者用古希臘神話中的薛西弗斯做比喻——在現代職場裡,我們不是在推石頭,而是在清理email inbox。剛清空就有新訊息來,永遠在重複同一件事。

真正的問題出在生產力的三層影響。首先是任務擴張:產品經理開始寫code、marketing開始做設計,不是公司正式改職責,只是AI讓這些事看起來可以嘗試。其次是工作邊界模糊:你會順手寫個提示詞、讓它先跑、等等再看,工作時間自然侵蝕非工作時間。第三是多工處理激增:邊做自己的事邊讓AI產文件,邊等一個agent邊開另一個session。每件事都在前進,但你的注意力一直在切換。

研究指出真正讓人感疲勞的,是不斷切換注意力、不斷檢查AI的產出、開著的任務越來越多。過去稀缺的是「誰來做」,現在稀缺的是「誰來看、誰來判斷、誰來確認下一步」。AI可以把工作往前推,但它推出來的每一個東西都要有人重新讀、重新理解、重新判斷,產生決策疲勞。這種審核成本最麻煩的地方是它無法被量化——沒有多開一場會、沒有多交一份報表,但你的腦子一直在切換、回想、比對、判斷。上級看不到這個成本,系統不會記錄,最後就變成表面上工作更有效率,事實上自己累成狗。

在更深的層面上,AI時代改變了能力的定義。以前產出東西難,所以能做出來就代表你會。現在AI把產出成本壓到趨近於零,人人都能更快做出更多東西,但這反而意味著你能不能做出來已經證明不了什麼。真正的證明變成了「有沒有真搞懂你做出來的東西」。產出變便宜了,但理解變貴了。這對剛入行的人特別殘忍——以前junior變強靠的是好幾年的瑣事:整理會議記錄、補文件、寫測試、清資料。沒人喜歡做,但過程本身就是教育,在一千件小事裡被有判斷力的人盯著,慢慢長出自己的判斷力。現在公司把這些瑣事自動化,順手也砍掉了junior職缺。每一個今年被砍掉的junior都本來會在三年後變成公司很需要的senior。

但學徒制真正運作的機制是逼自己重複理解,這不需要公司,自己就能建起來。方法就是逼自己搞懂每個產出的東西。量不重要,深度才重要。一個你徹底搞懂的專案,比十個vibe完就丟掉的專案教你更多。真正稀缺的是你到底有沒有搞懂自己做的東西:為什麼這樣設計、改哪裡會垮、你刻意沒做什麼以及原因。這些東西AI生不出來,一旦不懂,多問兩句就會露餡。品味也是從這裡長出來的——品味不是神祕美感,是你把足夠多的東西理解得夠深,深到開始認得出哪些有效、哪些會壞、哪些重要。理解是長出品味的唯一路徑,而品味是每波技術浪潮都沖不走的東西。

那該怎麼有效地審核AI的產出呢?講者提出一個格式問題:你跟AI之間用什麼形式在交接工作,直接決定你會不會被它的產出淹死。長期以來markdown是人與AI之間的通用語,因為它對人夠友善——純文字、打得開、改得動、可以grep搜索、可以git看改了哪幾行。連AI自己的腦子都選擇用markdown存記憶。但隨著agent越來越強,markdown開始不夠用了。Anthropic工程師Thariq最近分享了一篇文章《The Unreasonable Effectiveness of HTML》,指出超過100行的markdown自己就讀不下去了,更不要說讓公司其他人讀。當AI寫的spec和plan越來越長越來越複雜,好幾百行的純文字形式理解成本太高。Markdown沒辦法放圖、沒辦法把兩個方案擺在一起並排對比、沒辦法互動、分享給別人也很痛苦。

HTML作為替代方案有三個主要使用場景。首先是比較:叫AI一次生六個版本的onboarding畫面,版面、互動、資訊密度都不一樣,全排進同一頁裡,每個底下標清楚它做了什麼取捨,並排掃一眼就能比。Markdown只能一個一個文字描述,你得在腦子裡自己拼回畫面,那個拼的動作就是審核成本。其次是理解:叫AI讀完rate limiter相關代碼產一頁explainer、一張流程圖、一個常見坑的專區、甚至十題選擇題驗證理解。不用翻文件也能知道重點在哪,一樣資訊量但更快理解並做決策。第三是決策:有30張Jira單要重排優先序,叫AI做一個網頁把每張ticket變成可拖的卡片,分成優先序等欄位。AI先用判斷幫你排好,你審核時像玩遊戲一樣拖拽分類,調整完按按鈕就自動轉成prompt回傳Claude。這三個用法的共同點是都不生成更多東西,而是把複雜資訊變成能看、能比較、能下決定的介面。

講者特別強調他不是說HTML一定比markdown好,也不是全面取代markdown。他自己的經驗是從一行一行讀code、到只讀markdown文檔、到掙扎要不要讀markdown,因為真的太長了。他的注意力沒有跟著AI的產能一起變多,需要的不是更多output而是更低成本的理解方式。Markdown的邊界就是這裡,HTML的價值也在這裡。HTML不是比較高級的markdown,而是另一種工作介面——markdown適合承載文字,HTML適合承載狀態、關係、對比和互動。真正的問題是你想解決什麼問題:要文字整理就用markdown,要回到任務快速看懂狀態比較方案做決定就用HTML。

最後講者談到身為AI Builder或AI Developer該怎麼脫穎而出。Markdown也好HTML也好,真正重要的點在於你有沒有理解AI這個黑盒子裡發生了什麼。你真的知道自己在做什麼,還是只在Claude請求許可時一直按Enter不知道自己批准什麼?AI時代最大變化是產出變得太便宜,以前履歷職稱學歷作品集有用是因為做出像樣東西很難,你做得出來某程度就代表你會。現在AI幫你生出漂亮報告或能跑的prototype,但這些東西已經越來越不能證明你真懂。真正稀缺的是能不能把理解跟作品綁在一起——不只交出結果,能清楚回答四個問題:你做的東西是什麼?為什麼選擇這個做法?什麼情況下會壞掉?學到什麼?AI時代能力證明不要只追求更多產出,而要追求更深理解。不要讓作品跟解釋分開,讓解釋本身變成產出的一部分。不要只靠履歷頭銜credentials,而用可驗證的完成紀錄公開展示判斷、取捨、理解。Proof要跟著work一起走,你的能力證明要留在作品裡。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。