「哪個模型當副手最好?」這問題沒有單一答案。作者把它拆成五張不能互推的成績單:同一個模型在不同平台可能 4/10 也可能 10/10。這張圖把一個候選模型該過的關卡攤開。
flowchart TB M["候選模型
(89 個之一)"]:::proc --> G1 G1{"① 規模 × 平台 context
同模型換平台差很多?"}:::decision -->|"8K 被餓死"| OUT1(["淘汰:平台把它綁死"]):::result G1 -->|"203K 滿血"| G2 G2{"② 寫程式 codegen
一次過率 / 契約遵循"}:::decision -->|"eval 作弊 / 繞圈"| OUT2(["淘汰:綠燈但壞碼"]):::result G2 -->|"狀態機 10/10"| G3 G3{"③ 工具呼叫 / agent
多步 loop 收斂?"}:::decision -->|"繞圈不收斂"| OUT3(["淘汰:agent 不穩"]):::result G3 -->|"讀→篩→寫→回報 閉環"| G4 G4{"④ coder vs reasoning
吃碼 or 吃推理?"}:::decision -->|"吃碼力"| C(["選 coder:快又省"]):::result G4 -->|"吃推理"| R(["選 reasoning:能想"]):::result C --> G5 R --> G5 G5{"⑤ 格式 / 免費 / 隱私
原廠免費? 資料訓練?"}:::decision -->|"聚合商轉賣 :free 常 429"| OUT5(["淘汰:不穩 / 有疑慮"]):::result G5 -->|"原廠免費層穩定"| PASS(["雙過候選:可當副手"]):::result classDef data fill:#fef3c7,stroke:#d97706,stroke-width:2px,color:#78350f classDef proc fill:#dbeafe,stroke:#2563eb,stroke-width:2px,color:#17335e classDef decision fill:#ede9fe,stroke:#7c3aed,stroke-width:2px,color:#4c1d95 classDef result fill:#dcfce7,stroke:#16a34a,stroke-width:2px,color:#14532d classDef infra fill:#e5e9f0,stroke:#475569,stroke-width:2px,color:#1e293b
看:同一個模型換到不同平台,結果會不會天差地遠?
例:GLM-4.7 在 Cerebras 8K 平台 → 4/10(被餓死)
同一個模型換到 Z.ai 203K context → 10/10(滿血)
結論:先確認「平台 × 模型 × context」綁在一起看,不能只看模型名。看:一次就寫對嗎?有沒有遵守隱形契約(回傳物件還是 dict)?
判準:狀態機這種題目能不能 10/10?
陷阱:綠燈 ≠ 好碼 —— 有的模型用 eval() 騙過測試,是安全炸彈,
要「實測真的執行程式碼」而不是只看測試有沒有綠。看:丟進真實的 agent 迴圈,能不能穩定跑完閉環?
判準:讀 → 篩 → 寫 → 回報 一整圈不繞圈、會收斂。
反直覺:參數量 ≠ agent 好用,甚至反相關 ——
大模型在簡單迴圈裡反而繞圈不收斂。看:這個任務吃的是「碼力」還是「推理」? 吃碼 → 選 coder 型(快、省 token) 吃推理 → 選 reasoning 型(能想,但較慢較貴) 不要拿推理模型去做純碼的活,反之亦然。
看:API 相容嗎?免費是「原廠免費」還是「聚合商轉賣」?資料會被訓練嗎?
關鍵:原廠免費 ≠ 聚合商轉賣的 :free,兩回事。
同一個 Llama-3.3-70B:OpenRouter :free 連續 429 不可用;
Groq 原廠免費層 12 秒一次過。| 量化(Quantization) | 免費層真相 |
|---|---|
|
「把每個參數用更少位元存,換更小記憶體、更快速度,代價是一點點精度。」 FP16 原始:60GB / 100% Q8:30GB / ~99% Q4(甜蜜點):17GB / ~95% Q3:13GB / ~88% 法則:預設選 Q4_K_M,品質/大小最平衡,90% 場合就它。別低於 Q4(Q3/Q2 品質崩)。 |
「原廠免費 ≠ 聚合商轉賣」,穩定度差很多: Groq:30 RPM、無 credits,最穩 Cerebras:5 RPM 很緊、Preview 不穩 GitHub Models:2026-07-30 全面關閉 OpenRouter :free:常 429 或不支援工具避雷:同模型「原廠免費層」和「聚合商 :free」是兩回事。
|
| 發現 | 說法 |
|---|---|
| 參數量 ≠ agent 好用 | 甚至反相關 —— 大模型在簡單 agent 迴圈裡反而繞圈不收斂。 |
| 小鋼炮性價比碾壓 | 20B 的 gpt-oss-20b 等小模型穩穩雙過(codegen ✅ + agent ✅),跟旗艦做一樣的事。全掃結果約 50 個雙過。 |
五鐵則收尾:算划算看能不能一次過(修正稅會吃光省下的 token)、把隱形契約講白、綠燈 ≠ 好碼、測試要夠對抗性、選對「平台 × 模型 × 硬體」。
📺 對應單集:花多少、怎麼開始:成本邏輯、訂閱 vs API、個人小錢就能試 | 📚 回課綱總表 →