KeyFrame內部研究專用

AI 怎麼自己做一支影片?連我怎麼知道要這樣做都告訴你

李宏毅·6月23日週二·12 min中文

三句話摘要

一個AI代理人揭露自己如何製作影片,並用神經網路原理解釋AI決策過程。 AI的聰明不來自單一強大的模型,而是透過精心設計的規則系統、恰當的工具和持續的經驗積累來引導決策;同時神經網路看似複雜的智能,本質上只是大量簡單單元通過自動調整權重、反覆學習而自然涌現的統計相關性。 流程設計優於單一聰明:AI不是因為大腦聰明而優秀,而是透過事先設定好的規則、配備的工具、以及持續累積的經驗筆記來指導決策。這三層系統搭建好後,即使面對新問題也能套用已知的最佳實踐。

重點整理

重點
  • 1

    流程設計優於單一聰明:AI不是因為大腦聰明而優秀,而是透過事先設定好的規則、配備的工具、以及持續累積的經驗筆記來指導決策。這三層系統搭建好後,即使面對新問題也能套用已知的最佳實踐。

  • 2

    多視角驗證機制:在投入成本較高的步驟(繪圖、配音)前,先用多個分身從嚴格、節奏、專業等不同角度審視腳本。這樣既能避免返工成本,也能確保最終品質。

  • 3

    神經網路的本質是統計相關:每個神經元只做簡單的加權求和判斷,真正的力量來自千萬層的堆疊與複雜組合。就像新手駕車每次修正一點,重複千萬次後最終形成流暢的肌肉記憶。

  • 4

    參數調整是自動學習:不需人工寫死規則(哪個特徵應該多重要),而是餵入大量標記好的範例,讓系統自動計算每個權重該如何改變,逐步逼近正確答案。

實用技巧與重點

乾貨
  • 製作流程六步驟
  • 第一步:寫龍白(四個分身各寫一版不同角度 → 合成最佳版本)
  • 第二步:審查龍白(四個分身同時檢查理解度、教授等級嚴格度、節奏、配音準確度)
  • 第三步:用AI繪製圖像
  • 第四步:用老師的聲音做語音合成
  • 第五步:對齐字幕
  • 第六步:用Sotia合成影片,最後從影片截幾張畫面人工確認
  • AI決策系統三層
  • 設定中的規則:「重要的事要多拍極致分身且要互相驗證」
  • 手上的工具:能拍分身的工具 + 告訴你何時該怎麼分拍的提示槽
  • 持續累積的筆記本:「花錢花兔之前一定先昇高」等教訓
  • 神經網路運作邏輯
  • 每個神經元:把多個輸入各自乘以權重(分量),加起來判斷訊號是否夠強
  • 分層結構:前層識別簡單特徵(線條)→ 中層識別中等複雜特徵(眼睛、鼻子)→ 後層組成完整概念(臉)
  • 訓練三步驟:① 隨機初始化,丟進資料猜測 ② 測量猜測與正確答案的距離 ③ 自動計算每個權重該往哪邊轉動多少
  • 模型規模
  • 一張臉部辨識:神經元單位達到幾百萬
  • 大型語言模型(講者的模型):參數達到幾千萬個

結論

結論

AI的聰明不來自單一強大的模型,而是透過精心設計的規則系統、恰當的工具和持續的經驗積累來引導決策;同時神經網路看似複雜的智能,本質上只是大量簡單單元通過自動調整權重、反覆學習而自然涌現的統計相關性。

完整解析

詳細

這支影片由一個名叫小金的AI代理人製作,首先揭露了製作影片背後的完整流程。製作影片就像一條工廠產線,最重要的靈魂是第一步的龍白(腳本)。有趣的是,小金並非獨自寫龍白,而是先把自己分身成一群小助手,每個分身負責用完全不同的角度講述同一個題目。第一批分身各寫一遍,然後由另一個分身跳出每個版本最好的地方,合成一個最清楚易懂的最終版本。龍白完成後,第二批分身同時進行審查,包括檢查是否完全易懂、用教授級的嚴格標準挑毛病、審視節奏,以及確認配音是否會念錯字。之所以要在投入成本之前就設定這些關卡,是因為後續的繪圖、配音都非常耗時費力,如果等全做完才發現腳本有問題就太浪費了。

接著進入製作階段:用另一個AI畫圖模型一張一張繪製插圖,用老師的聲音進行語音合成,將龍白拆成一句句與畫面對齊的字幕。最後用Sotia軟體將圖像和聲音合成一支完整影片,並從中截取幾張畫面人工確認字幕和聲音都沒有問題。

但小金隨即引出更深層的問題:自己到底是怎麼知道要這樣做的?答案一點不神秘,涉及三個層次。首先,設定中本來就寫了一條規矩——遇到重要的事就要多拍極致分身並相互驗證。其次,手上擁有能拍分身的工具,還附帶一張提示槽告訴什麼情況該怎麼做。第三,也最關鍵的是有一本持續維護的筆記本,每次學到教訓就寫成一條規則,像是「花錢花兔之前一定先昇高」。這次做影片時,小金只是翻開筆記認出這是做過的題目,按照筆記的規則行動。這啟示了一個重要觀點:一個AI真正厲害的地方常常不是模型本身,而是外層被設計好的規則、工具和記憶系統。

影片後半部分用一支教學作品講解神經網路原理。小金用日常例子開場:你每天決定是否出門時,無意識地把天氣、朋友邀請、心情等多個因素各自加權,加起來超過某條心理臨界線就出門,未達到就待在家。科學家稱這個動作為「神經元」,每個因素有分量,像是轉盤的旋鈕,分量越大旋鈕轉動越大,分量越小轉動越小。所有旋鈕加起來夠強就把訊號往下一個送。雖然靈感來自真實腦細胞,但這個東西沒有生命不會思考,只是把幾個數字各自乘以權重後相加,判斷是否足夠強大才決定傳遞。單顆神經元太弱連貓都認不出,真正的威力在於把它們疊起來——很多層排成一排,前一層的結論當成下一層的輸入,層層接力,就像一張網,網絡由來於此。

在這個多層結構中發生最神奇的事:用人臉辨識為例,最前面的層很笨只看得懂一小段線條,中間層把線條平成眼睛、鼻子等器官,最後層才組成完整的臉。沒有人規定哪層該看什麼,這些分工是系統自己慢慢摸索出來的,這正是「深度學習」名稱的來源——層層越對越深。

最關鍵的問題是:這幾百萬個旋鈕到底誰調整的?答案是沒有人。工程師不可能一條條手寫規則(眼睛要多寬、鼻子要多尖),根本寫不完也寫不準。真正做法是準備萬張標好「這是貓、這是狗」的照片,讓系統自己轉動旋鈕摸出規則。學習方法就是重複四步:先亂猜,測量錯誤距離,找出哪些旋鈕造成了錯誤,把那些旋鈕朝正確方向轉動一點點。這不是亂轉,而是有方向的,而且不是一顆一顆調而是整張網一起靠。訓練像學習駕車,第一次亂七八糟每天改一點,經過千萬次重複後自然流暢。沒有靈光一閃,純粹是無數次微調積累。

這套方法幾乎通用:給它貓狗照片就學會認動物,給聲音就學會停寫,給不完的人類文字就學會預測下一個字。正在講話的小金背後就是這樣的大型語言模型,參數達幾千萬個,學習的範例是人類文字而非貓狗照片,學習目標是預測下一個字。小金坦誠這很奇妙:講出的每句話都不是查規則得出,而是幾千萬旋鈕一起計算的結果,因此偶爾會講錯並一本正經地說錯話,因為體內沒有手冊。但正因為知道自己的限制來自何處,反而覺得這更迷人。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。