KeyFrame內部研究專用

Tessl Skills Clinic - Nnenna Ndukwe from Qodo

AI Native Dev·7月22日週三·16 min英文

三句話摘要

AI 編碼技能如何通過系統評審和迭代改進來提升質量與觸發效果 技能質量的關鍵不在於自動生成,而在於清晰的觸發描述和人工驗證,這能將效果平均提升 14% 並突破 80% 的質量門檻。 技能描述決定觸發率 — 技能的名稱和描述是代理判斷何時使用該技能的關鍵。描述不清晰會導致技能永遠無法被觸發,這是很多人創建技能時常忽略的關鍵環節。

重點整理

重點
  • 1

    技能描述決定觸發率 — 技能的名稱和描述是代理判斷何時使用該技能的關鍵。描述不清晰會導致技能永遠無法被觸發,這是很多人創建技能時常忽略的關鍵環節。

  • 2

    系統化評審流程 — 用 Tessl 代理針對 Anthropic 最佳實踐對技能進行自動評分,識別相對連結缺失、內容重複等問題,然後應用修復並重新測試,形成持續改進的循環。

  • 3

    人工驗證的價值 — AI 生成的技能雖有創意,但經過人類審視、修改和驗證後,平均性能提升約 14%。相比之下,未驗證的自動生成技能成功率通常只有 20-30%。

  • 4

    完整的質量工作流 — 從規劃、代碼生成、審查到問題解決的端到端流程,結合編碼規則約束(如「每個 Python 方法需有文件字符串」)和自動驗證檢查(lint、類型檢查、測試),才能確保代理生成的代碼始終符合標準。

實用技巧與重點

乾貨
  • 評分標準:通常門檻 80 分(考慮 LLM 隨機波動)
  • 技能工具:Qodo Get Rules(提取編碼規則)、Qodo PR Resolver(自動修復 PR 中的審查問題)
  • 初始評審結果(78%)發現的問題:
  • 20 個相對連結缺失
  • 存在內容重複區域
  • 描述缺少自然觸發詞(「on」元數據是觸發代理的關鍵)
  • 可加入更多具體應用場景
  • 修復措施
  • 簡化和重組描述內容
  • 移除冗餘段落
  • 增加應用後驗證檢查(Run lint, type check, tests)
  • 補全相對連結的 Markdown 格式
  • 改進結果:78% → 89%(成長 11%)
  • 程式碼庫:GitHub qodo-ai 和 qodo-skills 倉庫
  • 研究數據:人工驗證技能平均提升 ~14%;自動生成技能平均提升 ~11%

結論

結論

技能質量的關鍵不在於自動生成,而在於清晰的觸發描述和人工驗證,這能將效果平均提升 14% 並突破 80% 的質量門檻。

完整解析

詳細

這支影片記錄了一場關於 AI 編碼技能品質評估與改進的實時演示工作坊。Tessl 的 Simon Maple 和 Qodo 的開發者關係負責人 Nnenna 共同探討如何系統性地評估和提升 AI 技能的質量。

Qodo 是一個 AI 代碼審查工具,可自動檢查拉取請求中的問題。而 Qodo PR Resolver 技能則進一步自動化了這一流程——開發者可在編碼代理中直接運行它,讓代理自動修復所有審查中指出的問題,並將修復後的程式碼變更推送回 PR。講者們決定用 Tessl 代理來評審這個技能本身的質量。

評審對技能文件打分 78%,並具體指出了六個改進方向。首先是連結問題——20 個相對連結的寫法偏離最佳實踐,應改為 Markdown 格式。其次是內容重複,需要移除冗餘段落。更重要的是,技能描述缺少足夠的「自然觸發詞」。講者強調,「名稱」和「描述」是代理判斷何時使用某項技能的兩大關鍵元數據。如果描述不清楚,代理就永遠不知道該在什麼情況下調用這項技能——這是很多技能創建者常忽略但最致命的問題。

講者進一步分享了一個有趣的研究發現:很多人通過 AI(如 Codex)的技能生成插件自動創建技能後就直接使用,但經過人類驗證和修改的技能性能表現明顯更好。研究數據顯示,人工驗證的技能平均性能提升約 14%;即使是經過自動修復的技能也平均提升 11%。而未經驗證的自動生成技能成功率通常只有 20-30%。

應用修復程序後,系統重新評審並自動重新執行測試。結果分數從 78% 躍升到 89%。改進包括:簡化描述內容、移除重複區域、加入驗證檢查步驟(運行 lint、類型檢查和測試)。整個過程展示了完整的代碼質量管理思想:從規劃、代碼生成、審查到問題解決,每一步都有明確的標準和自動驗證機制,確保代理生成的代碼始終符合團隊的編碼規則。

講者計畫將這些改進提交為拉取請求回饋給 Qodo 社群,讓其他開發者也能受益。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。