Grok 4.7 正式推出:xAI 新模型功能與發佈解析 2026
2026年09月29日
xAI 在 2026 年 9 月 21 日正式推出 Grok 4.7,官方定位是「最強的編碼與知識工作模型」。
xAI 在 2026 年 9 月 21 日正式推出 Grok 4.7,官方定位是「最強的編碼與知識工作模型」。這次的重點不是漲價或換代號,而是一句話就能概括的策略:同價同速,全面提升。輸入價格維持在每百萬詞元 2 美元,輸出每百萬詞元 6 美元,和 Grok 4.6 完全一樣。
這款 Grok 新模型發佈之後已經開始滾動推送,使用者會在 X 平台與 Grok 應用上陸續看到它。對關心人工智能發展的讀者來說,Grok 發佈的節奏值得追蹤,因為它同時反映了模型能力與定價策略的走向。對開發者來說,更值得注意的是它在幾項硬指標上的躍進。以 Terminal-Bench 4.0 為例,分數從 Grok 4.6 的 20.3% 直接跳到 38.0%,接近翻倍;在法律與電機工程這類偏門領域,領先幅度更明顯。
這篇文章會把 Grok 4.7 改了什麼、這些分數實際代表什麼,以及在手機上使用它該注意哪些事,一次講清楚。
Grok 4.7 這次推出了什麼
Grok 4.7 是 xAI 的新一代旗艦模型,相較於 Grok 4.6,它換上一個全新、更大的基座模型,並且在強化學習訓練上投入更長時間。訓練任務的難度也提高了,偏向那些需要數小時才能完成的長程任務。
官方特別強調兩個能力面向。第一是自我驗證:模型更擅長檢查自己的工作,在長任務中途較不容易跑偏。第二是長上下文管理:面對需要持續數小時的代理任務,能不能記住並正確運用先前的脈絡,往往是成敗關鍵。此外,xAI 表示 Grok 4.7 原生理解自家的 Grok Bot 框架,因此在對話與一般知識工作上表現更好。
安全層面也做了一次更新。xAI 稱 Grok 4.7 用了全新的防護堆疊,是他們測試過拒絕不當請求與抵抗越獄最強的模型。在資安與生物這類雙用途領域,它同時兼顧正當任務的實用性與危險請求的拒絕率,並在 LatchBio 的生物安全基準拿下 62.4%。
Grok 4.7 的基準分數拆解
單看一個分數容易失真,把 Grok 4.7 和同級對手放在一起看會更清楚。下表整理官方公布的幾項基準,分別對照 Grok 4.6、GPT-5.6 Sol 與 Fable 5.1。
| 基準項目 | Grok 4.7 | Grok 4.6 | GPT-5.6 Sol | Fable 5.1 |
|---|---|---|---|---|
| CursorBench 4.0(軟體工程) | 46.3% | 40.4% | 41.7% | 51.8% |
| DeepSWE v1.1 | 71.0% | 65.2% | 72.7% | 70.0% |
| EEBench(電機工程) | 64.0% | 53.0% | 39.4% | 56.4% |
| AA Briefcase v1.1(多小時辦公) | 1,657 | 1,546 | 1,487 | 1,678 |
| Terminal-Bench 4.0 | 38.0% | 20.3% | 37.3% | 57.9% |
| Harvey 法律代理基準 | 19.6% | 15.8% | 2.5% | 6.7% |
| HealthBench Professional | 56.7% | 48.5% | 60.5% | 62.1% |
從這張表可以看出幾個重點。在 CursorBench 4.0 上,Grok 4.7 拿到 46.3%,比 Grok 4.6 的 40.4% 有明顯提升,也超過 GPT-5.6 Sol 的 41.7%,但仍低於 Fable 5.1 的 51.8%。在 DeepSWE v1.1 與 HealthBench Professional 這兩項,它則不是最領先的一方。領先幅度最大的項目是 Harvey 法律代理基準,19.6% 明顯高於對手的個位數,以及 EEBench 的 64.0%。
這些數字的意義是:Grok 4.7 在不同領域的表現強弱不一,沒有一個模型在所有項目都通吃。挑選時要對照自己最常用的任務,而不是只看總排名。
為什麼「同價同速」比漲分數更關鍵
對多數使用者與開發者來說,價格往往比多幾分更有決定性。Grok 4.7 的定價與 Grok 4.6 完全相同,輸入每百萬詞元 2 美元、輸出每百萬詞元 6 美元。對照同級對手,GPT-5.6 Sol 是 4 美元與 20 美元,Fable 5.1 則是 10 美元與 50 美元。
換個說法:用 Fable 5.1 呼叫一次的預算,大概可以呼叫 Grok 4.7 五到八次。此外還有一個 fast 變體,輸出速度翻倍、價格也翻倍,但即使如此,單位成本仍低於多數競品。對需要大量呼叫的代理工作流來說,這個價差會直接反映在帳單上。
Grok 4.7 對開發者與使用者的實際影響
Grok 4.7 的主戰場是編碼與知識工作,這也界定了它最適合的用途。
第一類是長時間運行的編碼任務。CursorBench 4.0 衡量的正是這類需要多輪修改、反覆驗證的工作。Grok 4.7 在自我檢查上的強化,對「模型自己跑很久、中途跑偏」的問題有直接幫助。
第二類是需要專業判斷的知識工作。GDPval 這類基準模擬律師、護理師與財務分析師的實際任務,xAI 表示 Grok 4.7 在此有所進步,並開發出更好的文件與簡報生成能力。
第三類是長程代理與工具呼叫。隨著模型更會管理長上下文與使用自家框架,把它接進自動化流程會比前代更穩。對開發者而言,最實際的做法是先在自己的核心任務上跑一輪,比較前後代的成功率與成本,再決定是否切換。
在手機上使用 Grok 4.7 與行動端差異
Grok 4.7 的第一線入口是 Grok 應用與 X 平台。在 Android 手機上,你可以直接對話、請它整理資料、草擬文字或做研究摘要,這些都是它支援的通用場景。
行動端與桌面端的差別,主要在「誰來執行操作」。手機適合隨手查詢、寫作輔助與即時問答;比較複雜的編碼或長時間代理任務,則較適合在桌面或透過 API 進行。儲存空間方面,行動應用的本體不會因為模型升級而大幅膨脹,因為模型主要在雲端運行,手機端負責的是介面與連線。
使用 Grok 4.7 前該知道的事
- 推送是分批的:發佈後採滾動方式上線,你若第一時間沒看到新版本,屬於正常。
- 分數有領域差異:Grok 4.7 在編碼與工程領域亮眼,但在部分臨床與軟體工程項目並非第一,挑選要對照自身用途。
- 安全測試有其範圍:拒絕率與越獄抵抗的成績來自特定測試,不代表所有情境都萬無一失。
- fast 變體要算成本:速度翻倍伴隨價格翻倍,是否划算取決於你對延遲的敏感度。
- 價格與速度會變:官方標示的數字可能隨方案調整,長期使用仍要定期核對。
結語
Grok 4.7 的價值不在於某一項碾壓對手,而在於它在維持原價的前提下,把編碼、工程與長程任務的能力一起往上推。對開發者來說,它是一個值得納入候選的選項,特別適合成本敏感、又需要長時間運行代理流程的場景。對一般使用者而言,短期最直接的感受是手機上的助手在整理與寫作上更順手。想第一時間體驗,可以透過 Google Play 下載 Grok,用你現有的帳號登入,實際比較它和前一代在問答與任務處理上的差別。挑模型時,先想清楚你最在意的是價格、速度,還是特定領域的準確度,會比單看排行榜更有用。使用時也要留意權限與安全設定,尤其是讓模型自行操作工具或帳號的場景,建議先確認授權範圍再放行。
更新說明:Grok 4.7 由 xAI 於 2026 年 9 月 21 日正式推出,主要變化包含更換更大基座模型、延長強化學習訓練、強化自我驗證與長上下文管理,並採用全新防護堆疊;價格與 Grok 4.6 相同,採滾動推送方式上線。