小米 MiMo-V2.6 Pro 開源解析:開源權重第一的 1T 參數模型
2026年09月29日
小米在 2026 年 9 月 21 日把 MiMo-V2.6 開源,並一次釋出 Pro 與 Flash 兩個版本。
小米在 2026 年 9 月 21 日把 MiMo-V2.6 開源,並一次釋出 Pro 與 Flash 兩個版本。它的旗艦 MiMo-V2.6-Pro 在 Artificial Analysis Intelligence Index 上拿到 46 分,成為當下分數最高的開源權重模型。這個數字不是普通的進步:上一代 MiMo-V2.5-Pro 只有 26 分,一代之間跳了 20 分。
對多數人來說,開源模型的新聞常有「跟我的日常沒關係」的印象。但 MiMo-V2.6 的意義在於,它把接近前沿的推理能力,用一個很低的價格放到檯面上。一億個詞元(token)的輸出只要 0.87 美元,平均每題評測任務成本約 0.13 美元。這代表不想付高價訂閱的人,也能透過 API 或自架把一個 1T 參數級的人工智能模型用起來。
這篇文章會說明 MiMo-V2.6 是什麼、它的架構為什麼能壓低成本、1T 參數對實際使用意味著什麼,以及繁體中文使用者在哪裡能接觸到它。
MiMo-V2.6 是什麼?
MiMo-V2.6 是小米開發的人工智能模型系列,這次以開源方式發布。所謂開源,指的是模型權重(checkpoint)可以下載,任何人都能在自己的機器上跑,或接到自己的系統裡。小米把權重放在 Hugging Face,並採用 MIT 授權,這在大型模型圈屬於相當寬鬆的條款。
這一版不是單一模型,而是三個面向不同需求的版本:
- MiMo-V2.6-Pro:旗艦多模態推理模型,1.02 兆參數的專家混合架構,對應複雜編程、研究與長時間的代理任務。
- MiMo-V2.6-Flash:較低成本的多模態推理模型,適合高頻請求與延遲敏感的場景。
- MiMo-V2.6-Pro-UltraSpeed:針對服務速度優化的版本,小米稱在品質相近的前提下,輸出速度約為 Pro 的十倍。
三個版本都支援一百萬詞元的上下文窗口,並且原生支援文字、圖像、影片與音訊輸入。換句話說,它是「全模態」的:不只能讀文字,也能看圖、看影片、聽聲音。
MiMo V2.6 Pro 的架構怎麼壓低推理成本
MiMo V2.6 Pro 的核心是稀疏專家混合(sparse mixture-of-experts)架構,總參數約 1.02 兆,但每個詞元只會啟動其中約 420 億個參數。這個設計的邏輯不難理解:把模型拆成很多專門的「專家」層,每次只叫用少數幾個,計算量就降下來,但可用的權重池還是很大。
成本能壓低,關鍵在兩件事。第一是稀疏啟動,讓每次推理實際動用的算力遠小於參數總量。第二是快取折扣,小米對重複送出的輸入提供最高 99% 的折價。對於會反覆送出同一段系統提示、同一份程式庫脈絡或同一組工具定義的代理工作流,這項折扣直接把帳單拉低。要注意的是,實際省下多少取決於命中率,也要對照當前的 API 文件確認計費規則。
UltraSpeed 版本走的是另一條路:小米選擇性地只把 MXFP4 四位元格式套用在專家層。測試顯示,把整個模型都量化會傷到推理與程式生成品質,所以路由與其他模組保留較高精度。搭配 TileRT 的合作,小米聲稱這個兆級模型在一般顯示卡上能做到每秒超過一千個詞元的生成速度。
還有一個值得留意的細節:小米把強化學習後訓練的過程開放到網路上。儀表板顯示步數、獎勵曲線、詞元吞吐、沙箱狀態與即時成本估算。Pro 的強化學習花費約 262 萬美元,Flash 約 85.4 萬美元,每一步處理約七億五千萬個詞元。這種「公開訓練」的做法,在數據揭露上算是少見。
1T 參數代表什麼?對使用者的實際差別
1T 參數聽起來很大,但它對一般使用者的意義要分兩層看。第一層是能力潛力:參數量與架構決定了模型能記住、能推理的複雜度上限。第二層是實際可用性:權重越大,自己架設的門檻越高。
用四位元格式估算,1.02 兆的權重約需要 510 GB 的儲存,而且這還沒算中介資料、較高精度層與鍵值快取。小米的混合精度版本會需要更多,所以對多數團隊來說,透過 API 使用會比自行架設來得務實。這也是開源模型的一個常見取捨:權重是公開的,但「跑得動」是另一回事。
真正對開發者有用的,是 46 分這個分數背後代表什麼。Artificial Analysis Intelligence Index 是把多項能力評測彙整成一個總分,方便橫向比較。分數會隨模型與測試集更新而變動,所以這一代 20 分的成長,比「暫時第一」的排名更有參考價值。
全模態與一百萬詞元上下文能做什麼
MiMo-V2.6 主打的是代理工作流。所謂代理,是指模型會自己規劃多個步驟、呼叫外部工具、讀取結果,然後繼續做到任務完成。這類系統對模型的指令保持、錯誤恢復與工具選擇能力要求很高,因為使用者的一個請求,可能觸發數百次模型呼叫。
一百萬詞元的上下文窗口,能做的是把更多檔案、文件與對話歷史一次放進來,讓模型在整個任務過程中都記得脈絡。但要提醒的是,最大上下文長度說的是 API 能接收多少,實際在這段長度上的檢索準確度與推理品質,還是要針對自己的場景測過才算數。
全模態的部分,圖像、影片、音訊都能直接輸入,對需要看畫面除錯、整理會議或分析素材的用途特別實在。
繁體中文環境下能怎麼接觸 MiMo-V2.6
目前在繁體中文環境裡,最直接的接觸方式是透過第三方推理平台。像是 OpenRouter 已經上架 MiMo-V2.6-Pro-UltraSpeed 等版本,開發者可以比較不同供應商的價格與延遲,再決定要接哪一家。
第二種方式是自行架設。權重放在 Hugging Face,官方有提供 vLLM 與 SGLang 的部署示例,需要的是多張高階顯示卡與對應的記憶體。這條路適合有硬體資源、又在意資料不出門的團隊。
第三種是把它接進自己的代理工具。由於模型原生支援工具呼叫與推理流程,適合放進編程助手、研究系統或瀏覽器自動化這類「工具密集」的工作流裡。實務上,建議先在小範圍測它的指令遵循與成本,再擴大使用。
使用 MiMo-V2.6 前該知道的事
能力亮眼,但仍有幾個現實面要留意。
- 權重開放不等於全部透明:授權與權重是可得的,但訓練資料、獎勵模型與完整訓練設定,才是能否重現結果的關鍵,這些目前仍不完整。
- 自架門檻高:兆級參數即使稀疏化,記憶體與儲存需求依然可觀,多數團隊走 API 會更划算。
- 快取折扣有條件:99% 的折扣依賴重複命中,實際帳單還要看輸出長度、重試、工具呼叫迴圈與失敗次數。
- 價格與速度要自己驗:官方標示的速度是在特定硬體與批量條件下測得,換環境就不一定成立。
- 基準與生產是兩回事:分數高代表潛力,真實任務的穩定性仍需工作負載取向的測試。
- 資料與權限要自己把關:透過第三方平台或自架使用時,要注意資料流向、API 金鑰安全與存取權限的設定,避免把敏感內容送進無法掌控的環境。
結語
MiMo-V2.6 這次開源,最實在的意義是把接近前沿的人工智能模型,用一個容易負擔的價格放出來。對開發者來說,它值得放進候選清單,先針對自己最常跑的任務測一輪,再決定要不要長期使用。對一般使用者而言,短期內的變化不會立刻反映在手機上,但隨著更多服務接入這類開源權重模型,翻譯、摘要與問答的品質與價格,都會慢慢被拉動。挑模型時,先想清楚你最需要的是便宜、快,還是複雜推理,會比單純比排行榜分數更有用。