Amp 用內部 102 題 SWE 評測實測 GPT-5.5:medium 比 GPT-5.4 high 貴 39%,high 還比 medium 又貴又差。整理 reasoning 配置、prompt 風格轉變與 caching 限制的判斷。
⭐ 文章深度讀:你下次寫 ticket 時,會選 GPT-5.5 medium 還是繼續用 GPT-5.4 high?
→ https://heymaibao.com/amp-gpt-5-5-evaluation/
⚡ 章節重點
開場 00:00
降本錯覺:medium 比 5.4 high 貴 39% 00:54
reasoning 等級陷阱:high 又貴又差 02:46
跑分與現實的落差 03:56
Prompt 寫法翻新:腳手架換 outcome 04:38
caching 與 ZDR 細節 06:04
怎麼判斷該不該換 07:16
📝 懶人包
∙ Amp 內部 102 題 SWE eval:GPT 5.5 medium 拿 54 個 pass、花 $312,GPT 5.4 high 拿 53 個 pass、花 $225。品質大致相當,但 5.5 medium 貴了 39%。Amp 自己的話:「`GPT-5.5 is cheaper for the same quality.` 這句話不成立。」
∙ GPT 5.5 high 在同一份評測上只拿 50 個 pass、卻花了 $425,比 medium 又差又貴。 Amp 給的新預設是 medium,xhigh 留給高風險任務,low 用於 cheap-to-verify 小任務,high 不該再當保險選項。
∙ Prompt 寫法跟著翻新:從「先 inspect、再 plan、再 edit、再 test」這種流程腳手架,改成「Outcome / What good means / Constraints / How to verify」這種 outcome-focused 寫法。 Amp 自己也說,這個形狀「很像 Opus 4.7」。
∙ 我的觀察:這是少見的 vendor 自家評測,願意把不利自家敘事的數字寫得很清楚的案例。讀完最大的收穫不是「該不該升 GPT-5.5」,而是當模型公司的敘事 (更便宜) 跟 agent 廠商的實測 (更貴) 對撞時,預設要相信誰。
📚 參考資料
Amp 官方 model note:GPT-5.5
→ https://ampcode.com/models/gpt-5.5