10 minWhat Happens When GPT, Claude, and Gemini Rank Each Other Blindly?
Prompt Engineering
- 議會架構分三階段運作:每個模型獨立作答 → 互相盲排名並計分 → 主席模型(Opus 4.8)綜合所有回應產出最終答案並標記共識與分歧,理念來自傳統機器學習的 Ensemble 方法——多個弱學習器合力勝過單一強學習器。
- 角色分工是關鍵設計:給每個模型不同的人格設定(第一性原則記者、嚴格推理師、紅隊懷疑者等),目的是讓它們不要收斂到相似答案,主席也被要求浮現分歧而非將所有意見磨平成一鍋粥。
- 測試結果出乎意料:議會只在「開放式設計問題」中勝出,在「權衡取捨題」和「風險題」中輸了,在「事實題」上因為所有強模型都答對而無差異——顯示議會是判斷工具,不是計算器。




























