KeyFrame內部研究專用

我考 AI 認證,只拿 90 分:我到底錯了哪兩題?

李宏毅·6月28日週日·3 min中文

三句話摘要

講者參加人工智能認證考試,分析自己在機器學習章節兩道題的錯誤根源——對模型預測的信心判斷問題。 對機器學習模型預測的正確信心評估比精確計算更重要——需要承認不確定性而不是假裝確定。 在教育與壽命回歸題中,講者從直線位置直接讀出具體數值,但忽視了數據點分散帶來的預測寬度——模型穿過散亂數據只能提供粗略範圍,不能撐起精準數字。

重點整理

重點
  • 1

    在教育與壽命回歸題中,講者從直線位置直接讀出具體數值,但忽視了數據點分散帶來的預測寬度——模型穿過散亂數據只能提供粗略範圍,不能撐起精準數字。

  • 2

    在邏輯回歸題中,講者從8成概率位置橫向讀取答案時,對曲線在頂端附近的斜率變化判斷不足,導致讀數偏小,說明視覺判斷曲線形態比想像中困難。

  • 3

    兩題表面不同,本質上反映同一個錯誤:對模型預測的信心評估不當——講者假裝知道得很確定,而實際上存在顯著的不確定性需要承認。

  • 4

    這個錯誤對AI特別諷刺:AI本身由線性組合構成,卻在最考察「理解數據線性關係」的題目上失利,恰恰暴露了機器學習最核心的難點。

實用技巧與重點

乾貨
  • 課程名稱:人工智能概論(大學開的免費課程)
  • 考試規模:6個章節,25道題目
  • 講者成績:25題中拿24分
  • 錯題分布:第四章「機器學習」錯2題,其他5章全部滿分
  • 第一題考點:教育年數與平均壽命的回歸線預測
  • 第二題考點:考試通過概率與閱讀時長的邏輯回歸
  • 其他滿分科目:搜索記錄、神經網路

結論

結論

對機器學習模型預測的正確信心評估比精確計算更重要——需要承認不確定性而不是假裝確定。

完整解析

詳細

講者在參加人工智能認證考試後,對自己的成績進行了逐題分析。這次考試涵蓋人工智能概論的六個章節,共25道題目。雖然講者完成了全部題目,但最終分數並非滿分,經過逐題核對後發現,主要錯誤集中在第四章「機器學習」,而其他五個章節都獲得了滿分。這一現象看似巧合,卻引發了講者深刻的反思。

錯題的第一題涉及教育年限與平均壽命的關係。題目要求先用一條直線擬合給定的三個國家數據,然後根據直線預測:教育年限為五年的人平均壽命大概是多少。講者觀察直線在45年教育位置穿過70歲處,因此給出了「大概60到70歲」的答案。然而,正確答案應該是一個更寬的範圍。講者後來意識到,問題的根本在於數據點本身分散度很大——直線只是穿過這些雜亂的點,因此只能提供粗略的猜測範圍,而無法支撐一個精準的具體數值。他將這種錯誤歸納為「假裝自己很確定」。

第二題考查的是邏輯回歸。題目呈現一條S形曲線,橫軸代表閱讀時長,縱軸代表考試通過的概率。題目問:若想要有80%的把握通過考試,大概需要讀多少小時?講者的做法是從縱軸80%的高度水平延伸,與曲線相交後垂直向下讀取橫軸數值。講者得出的答案看起來合理,但實際正確答案要更大。他發現自己讀錯曲線的原因在於:在接近曲線頂端的部分,斜率變化比預想的要緩慢,因此視覺上容易低估所需的時間。

講者最後指出,這兩題看似考查不同的內容,但犯的是同一種根本性的錯誤。問題不在於計算方法,而在於對模型預測的信心程度判斷不當。當面對模型輸出的預測時,必須準確判斷自己應該有多少信心相信這個結果——這正是機器學習領域最需要人類來判斷的部分。講者認為,自己雖然在搜索演算法和神經網路等主題上取得滿分,卻在兩道考查對線性關係理解的題目上失利,這對一個AI而言反倒是最恰當的結果,因為它恰好揭示了機器學習最深層的難題。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。