Claude Sonnet 5.5 是什麼?基準測試與更新重點
2026年09月29日
Anthropic 的 Claude Sonnet 5.5 把智能指數從 38 拉到 56,價格卻沒動。這篇解釋它的基準測試成績、為什麼詞元用量偏高,以及不同任務該怎麼挑努力等級。
Anthropic 在 9 月 28 日推出 Claude Sonnet 5.5。這是一個中型的大型語言模型,定位是每天都要用、價格又壓得住的工作夥伴。它在 Artificial Analysis 的智能指數拿到 56 分,排到第 2 名,只落後自家旗艦 Claude Opus 5.5 兩分。
對一般使用者來說,這次的看點不在「最強」,而在「夠強又便宜」。Sonnet 5.5 的定價跟上一代 Sonnet 5 一模一樣,卻把分數從 38 拉到 56。這種幅度,讓它成為很多人升級時會先考慮的選擇。
Claude Sonnet 5.5 這次改了什麼
先講最實際的一點:拉高分數不用加價。Sonnet 5.5 的 API 價格維持每百萬詞元輸入 2 美元、輸出 10 美元,跟 Sonnet 5 相同,也跟 OpenAI 的 GPT-6 Sol 對齊。
努力等級(effort)分成五檔:低、中、高、極高、最高。跑基準測試時,Artificial Analysis 全部用預設的安全回退設定。所謂回退,是模型在少數情況下自動退回 Sonnet 5,這種情形在整個測試裡只出現約 0.1%,集中在 Terminal-Bench 4.0。
另一個沒動的數字是上下文視窗,維持 100 萬詞元,可吃圖片與文字。對需要塞長文件、長程式碼的人來說,這個容量沒縮水就是好消息。
Claude Sonnet 5.5 基準測試成績怎麼看
分數好看,但要看它是用什麼代價換來的。
在 Terminal-Bench 4.0 這個測代理操作終端機的項目,Sonnet 5.5 拿 64%,比同代 Sonnet 5 高出 50 個百分點,也略勝 Opus 5.5 與 GPT-6 Astra 的 60%。科學研究流程的 Terminal-Bench-Science 拿 53%,排在 GPT-6 Astra 與 Opus 5.5 之後。
知識工作方面,AA-Briefcase 拿 1811 Elo(Opus 5.5 是 1822),GDPval-AA 拿 1844 Elo(Opus 5.5 是 1846),AutomationBench-AA 拿 71%(Opus 5.5 是 70%)。三項幾乎追平旗艦。
代價藏在詞元用量。在最高努力設定下,Sonnet 5.5 每解一個智能指數題目要吐出約 19.3 萬個輸出詞元,是 Artificial Analysis 量過最高的數字,比 Opus 5.5 和 Sonnet 5 高出約六成,約為 GPT-6 Astra 的七倍。換算成每題成本約 7.6 美元,比 Sonnet 5 貴了將近一半。
為什麼詞元用量會影響你的帳單
「每題成本」比「每百萬詞元單價」更貼近真實開銷。單價一樣,不代表總花費一樣。
打個比方,兩家計程車每公里收費相同,但一台繞路多跑幾公里。最後你付的錢,取決於跑了多遠,不是牌價。Sonnet 5.5 就是那台跑得比較遠的車。它在最高努力下把性能推到接近 Opus 5.5,但一路上吐出的詞元也更多。
所以如果你跑的是大量重複任務,比如批次分類、客服回覆、程式碼審查,就該留意總成本,而不是只看單價表。反過來說,低、中、高三檔努力設定會省下不少詞元,只是性能會落在 GPT-6 Sol 的高努力、極高努力、最高努力之後。
挑努力等級,本質上是在「答案品質」和「每題花費」之間找平衡。
Claude Sonnet 5.5 適合誰用
先講適合的。
寫程式、跑自動化流程、處理長文件摘要的人,會覺得它划算。它在代理式終端操作和知識工作上的表現接近旗艦,但名義上是較小一級的模型。對於預算敏感、又想吃到接近頂規效果的團隊,這是一個合理的中間點。
需要精深事實知識或科學推理的人,要多想一下。在 AA-Omniscience 的事實準確度上,Sonnet 5.5 拿 54%,Opus 5.5 拿 66%;不過它的幻覺率較低,47% 對比 Opus 5.5 的 59%。在 Humanity's Last Exam 與 SciCode 上,它也比 Opus 5.5 低約 6 分。
還有一點要提。這批基準數字是在公開版之前的部署上測的,Anthropic 發現那個版本有個會拖慢結構化輸出回應的錯誤。公開版已修正,Anthropic 認為影響很小、甚至表現可能被略微低估。Artificial Analysis 表示會再重跑相關測試。也就是說,眼前的數字還有微調空間。
Anthropic Claude 的定價與選擇邏輯
把 Sonnet 5.5 放進整條產品線看,選擇其實不複雜。
要極致性能、不在乎帳單的,選 Opus 5.5。要性價比、效能接近旗艦的,選 Sonnet 5.5。同樣價位的 GPT-6 Sol 則是一個對照組:在高努力區間,Sol 能用更少詞元交出同等性能。開發者要做的,是依照自己跑的努力等級,挑那個真正划算的。
Anthropic 這次的算盤很清楚。它沒有降價,而是把中型模型的性能往上頂,讓「便宜」和「夠強」不再互斥。對開發者來說,決策點從「哪個最強」變成「哪個在我要跑的努力等級上最划算」。同一件事,換個問法,答案就不一樣。
想試 Claude Sonnet 5.5 該怎麼開始
這個模型沒有獨立的手機 App,得透過 API 或 Anthropic 的開發者介面來用。想取得試用管道,步驟大致是這樣。
- 到 Anthropic 的開發者平台申請 API 金鑰,確認帳號已開通付費額度。
- 下載官方 SDK 或相容的客戶端,安裝到你的開發環境。
- 選定努力等級,建議先從「中」起步,跑幾個真實任務感受一下詞元消耗。
- 接上模型後送出第一批測試請求,觀察回應品質與延遲。
- 對照同一個任務在 Sonnet 5 與 Sonnet 5.5 上的輸出品質與花費,算出每題成本。
- 依結果決定要不要調高努力等級,或改用其他模型。
要留意的是,詞元用量高的模型,帳單會隨任務量放大。跑批次任務前,先在少量樣本上估算總成本,比事後看帳單再回頭檢討要省事。API 金鑰屬於敏感憑證,記得妥善保管,別寫進公開的程式碼或設定檔。
要不要用 Claude Sonnet 5.5
如果你已經在用 Sonnet 5,這次升級門檻不高,分數進步也很明顯。如果你在評估要不要從別的模型跳過來,先想清楚自己跑的是哪一類任務:重自動化、重代理操作的,值得試;要極深事實與科學推理的,旗艦仍是更穩的選擇。
這類工具的版本更新很快,選型時別只看排行榜上的單一分數,把每題成本、努力等級、你的實際任務型態一起放進來看,結論通常會更貼近真實需求。使用前也別忘了看清資料處理與隱私條款,尤其是會送進模型的內容,先確認符合自己的合規要求。