DAY 252 · 2026-09-08

太強的模型不該做規劃

SLIDES · 7
Day 252 太強的模型不該做規劃 — 投影片 1Day 252 太強的模型不該做規劃 — 投影片 2Day 252 太強的模型不該做規劃 — 投影片 3Day 252 太強的模型不該做規劃 — 投影片 4Day 252 太強的模型不該做規劃 — 投影片 5Day 252 太強的模型不該做規劃 — 投影片 6Day 252 太強的模型不該做規劃 — 投影片 7
1 / 7

看到 Wisely Chen 寫的一篇文章,講 Columbia 大學 DAPLab 四月放出來的 AgentOpt 論文。裡面有一個數字我看了兩遍:在 HotpotQA 這個多跳問答(答案要靠搜尋工具跨好幾份文件湊出來)的測試上,把 Claude Opus 4.6 放在 planner(負責把任務分成小塊、派工的那一格)只拿到 31.71%;換成一個便宜到不行的 Ministral 3 8B 當 planner、Opus 4.6 當 solver(實際去查、把答案湊出來的那一格),拿到 74.27%。

差 42.6 個百分點,而且贏的那一組還便宜得多。

這篇分享:為什麼我現在要翻一篇四月的論文出來講、這個實驗到底做了什麼、Opus 為什麼會表現這麼差、哪種任務適合這樣分工、哪種不適合、成本差距有多誇張,還有 Anthropic 自己的 advisor 工具為什麼是同一個方向。

為什麼現在翻出一篇四月的論文

上一場 AI 小聚,有人分享自己的 agent 設定,講到用強的模型負責規劃、弱的模型負責實作。

這個講法很好記:難的事交給聰明的、雜的事交給便宜的,聽起來就是對的。好記的規則傳得特別快,久了就變成大家的預設做法,但很少有人回頭去驗證。

這篇論文剛好就在測這件事,而且結論跟大家的預設不一樣。我提這件事,不是要說誰講錯了——是想把這條太好記的規則拿出來質疑一次。

論文在測什麼

DAPLab 做的事情很單純:把 agent 管線裡的每一格當成一個變數,9 個模型互相排列,兩格的管線就是 81 種搭配,四個 benchmark(四組標準測驗)全部跑一遍,看哪一種最好。

模型池裡有 Claude Opus 4.6、Haiku 4.5、Claude 3 Haiku、gpt-oss-120b、gpt-oss-20b、Kimi K2.5、Qwen3 Next 80B、Qwen3 32B、Ministral 3 8B,走 AWS Bedrock、用 2026 年 3 月的價格計算。

HotpotQA 這一關的管線只有兩格:planner 把問題分成小塊、決定要查什麼,solver 拿著搜尋工具去查、把答案湊出來。

排名出來,Opus 當 planner 的 9 種組合,全部落在 81 名中的第 71 到 79 名。不是「表現普通」,是整排墊底。

Opus 不是答不出來,是它根本沒派工

論文裡有一個錯誤標記叫 role2_never_called——solver 從頭到尾沒有被呼叫過。

Opus 當 planner 的 9 種組合裡,有 7 種掛上了這個標記。

意思是:Opus 讀完題目,覺得自己知道答案,就直接寫了,沒有把工作交下去。而 HotpotQA 是多跳問答,答案要靠搜尋工具跨好幾份文件湊出來——它不派工,那個搜尋工具就完全沒被用到。它是憑記憶在答題。

Ministral 3 8B 沒有這個選項。它答不出來,所以它只能照著管線設計走:分工、交辦、等結果。

「弱」在這裡是架構上的優點

在一個「planner 必須派工給 solver」的架構裡,一個不會自作主張的模型,比一個什麼都會的模型更適合站在那一格。它的能力上限低,反而讓它百分之百遵守分工。

職場也是這樣。最強的那個工程師常常不是好主管——因為他看到問題就自己解掉了,事情從來沒有真正交出去。團隊學不到東西,他自己變成瓶頸,而且他解得再快,也只有一雙手。

差別在於,人你還可以提醒他「要放手」,模型你只能換掉那一格。

不是每種任務都要這樣配

這裡要小心,不要把「便宜的當 planner」變成新的萬用規則。同一篇論文裡,另外兩個 benchmark 的結論完全不一樣:

任務 最好的組合 數字
HotpotQA(吃搜尋工具的多跳問答) 便宜的 planner + Opus solver 74.27%,Opus 自己 planner 只有 31.71%
GPQA Diamond(純推理,不吃工具) 一個強模型單打 Opus 4.6 拿 74.75%
MathQA(answerer + critic) Opus 答、Haiku 4.5 挑錯 98.84%,但 9 個 critic 之間只差 2.9 個百分點

三行讀下來,決定規則的其實是任務的性質:

  • 任務要靠工具才做得完 → planner 那一格需要一個不會搶著自己答的模型
  • 任務就是純推理,沒有外部資訊要拿 → 別分工了,一個最強的直接上
  • critic 這種校閱角色 → 換誰差不多,錢花在 answerer 上比較划算

想知道自己的管線適不適用,最快的方法是把某一格換成便宜十倍的模型,同一份輸入、同一組評分再跑一次,比較看看。

成本的差距比準確度還誇張

準確度差幾個百分點還算好想像,成本這一欄的數字才是真的離譜。

論文比較「準確度相近」的組合之間差多少錢:

  • BFCL v3(連續多輪呼叫工具):Opus 72%、Qwen3 Next 71%——差 32 倍
  • MathQA:Opus + Opus 約 98.5%,Ministral + Claude 3 Haiku 拿 94.0%——差 24 倍

24 倍。同一份工作,成績從 98.5 掉到 94,帳單只剩原本的二十四分之一。這個取捨值不值得要看你在做什麼,但這件事值得先算一次。

Anthropic 的 advisor 工具是同一個方向

Anthropic 三月出的 advisor 工具,走的正好是這個邏輯的另一面。

它的做法是:主迴圈跑在便宜的模型上(Haiku 4.5、Sonnet 5 之類的 executor),遇到想不通的地方,才呼叫一個更強的模型(Opus 5、Opus 4.8)進來當顧問——工具是三月推出的,顧問模型清單後來才加進 Opus 5。顧問給完策略就退場,不接管控制權,執行的還是原來那隻。

技術上它是一個 server-side 工具,型別 advisor_20260301,要帶 beta 標頭 advisor-tool-2026-03-01。工具定義上有三個選填參數,最能看出它的設計意圖:

  • max_uses:這次請求最多能問幾次顧問
  • max_tokens:顧問一次能回多長
  • caching:把顧問自己那份 prompt 快取起來

Anthropic 在文件裡明講,advisor 的模型必須至少跟 executor 一樣強,配錯直接回 400。Wisely Chen 文章裡量到的顧問回覆長度大約是 400 到 700 個 token——它給的是方向,不是答案。

跟論文對起來看:論文說強模型不該站在會搶工作的那一格,advisor 則是把強模型改成「被叫的時候才來」。同一件事的兩種做法。

這個結論有保存期限

論文跑的是 2026 年 3 月那批模型,成本算的是那時候的 Bedrock 價格,Opus 那一欄還是 4.6,現在已經出到 Opus 5 了。模型每次改版,「它會不會自己把答案講完」這件事就可能整個變掉。

所以我不會把它當定論,是把它當一個要自己重測的假設。

論文和文章的立場其實一樣:agent 管線要最佳化的單位是這個組合跟這個任務合不合,不是單一模型有多強。

我原本的預設是「哪一格重要就放最強的」。看完之後要改成:先看那一格的工作性質,再決定放誰。


  • Day 251 最好的題目藏在抱怨裡(上一場小聚的預告)

來源:

延伸閱讀
看完整 252 篇 →