Liquid AI Open d1 是什麼:開源多模態決策模型 d1-3B 與 d1-omni-600M 解析
2026年10月08日
Liquid AI 發布 Open d1 開源決策模型,d1-3B 讀文字與圖像,d1-omni-600M 支援文字加音訊,主打從 DGX 到 Jetson 的邊緣即時決策。
Liquid AI 在 10 月 7 日開源了兩個模型,d1-3B 與 d1-omni-600M,隸屬於它的 d1 決策模型家族。這兩個模型最特別的地方,是它們不生成文字,而是直接吐出一個判斷。
這聽起來可能有點抽象,但對需要在邊緣裝置上做即時決策的人來說,這個差別很實際。以下講清楚決策模型是什麼、Open d1 強在哪、以及它在哪些場景派得上用場。
Liquid AI Open d1 是什麼
Open d1 是 Liquid AI 一組開源權重的多模態模型。d1-3B 能讀文字與圖像,實驗性質的 d1-omni-600M 則能處理文字搭配圖像,或文字搭配音訊。
跟一般生成式模型最大的不同,在於它們的輸出形式。傳統大型語言模型是一個詞元接一個詞元地生成句子,Open d1 這類決策模型不走這條路,它在一次前向傳遞中直接產出答案,過程中不吐出任何文字。
這代表它適合做的是「選一個」或「給一個值」的任務,例如分類、判斷、挑選,而不是寫文章或聊天。Liquid AI 把這條 Liquid AI 決策模型產品線定位在需要即時、結構化決策的場合,尤其是算力有限的邊緣裝置。
為什麼它不生成文字
生成模型與決策模型的分工,關鍵在延遲。生成文字需要逐個詞元推進,句子越長越慢;決策模型一次算完就結束,時間相對固定且可預測。
對即時系統來說,這種可預測性很值。自駕、工業檢測、語音互動這類場景,系統沒有本錢慢慢等一段文字生成完再判斷下一步。
Liquid AI 過去的模型是生成式的 Liquid Foundation Models(LFM),Open d1 則是另一條支線。同一個團隊用不同的架構目標做出不同性質的模型,這是這次開源值得留意的地方。
d1-3B 與 d1-omni-600M 的差別
兩個模型的定位不同。d1-3B 是主力,參數量約 30 億級,能讀文字與圖像,是這條線裡決策品質最好的一個。
d1-omni-600M 則是一個實驗性檢查點,參數量小得多,約 5.87 億,由一個 3.81 億的共享主幹加上決策頭、一個 9,400 萬的視覺編碼器與一個 1.12 億的音訊編碼器組成。它的特別之處是能處理三種模態,接收文字加圖像,或文字加音訊。
換句話說,想要品質選 d1-3B;想在極小的硬體上做多模態判斷,d1-omni-600M 是那條路。後者仍在積極開發,屬研究性質的釋出。
Open d1 的效能表現
d1-3B 在 Decision Index v0.2.1 公開分割上拿到 48.57 分,勝過所有 10B 以下的模型,與體積大它 12 倍的 Decider 35B-A3B 打平。體積小、分數不吃虧,是這條產品線的核心賣點。
速度方面更能說明定位。d1-3B 在一張 NVIDIA GeForce RTX 4090 上回答一個問題只需 8 毫秒,在 Jetson AGX Thor 上是 16 毫秒,在 Jetson AGX Orin 上是 26 毫秒,連最入門的 Jetson Orin Nano 也只要 50 毫秒。
值得注意的是它的狀態處理能力。在 3 題共用一份狀態的情況下,AGX Thor 只從 16 毫秒變成 20 毫秒,也就是說解答多個問題的成本增長很平緩。
在邊緣裝置上的實際意義
邊緣部署是 Open d1 的主戰場。Liquid AI 強調它跑得動完整的 NVIDIA 堆疊,從資料中心的 DGX,到 RTX 工作站,再到邊緣的 Jetson 系列,並且在推出當天就有 llama.cpp 支援。
這種「從資料中心一路到最小邊緣硬體都能跑」的能力,意味著同一個模型可以先用大機器開發與驗證,再直接下放到裝置上線,不必為不同平台重寫。
以 d1-3B 在 Jetson Orin Nano 上 50 毫秒的反應速度來說,它已經夠快,能在最小的邊緣硬體上做即時判斷。對於要在現場做決策、又不想把資料傳回雲端的應用,這是一條可行路線。
誰適合用、怎麼取得
Open d1 主要面向開發者與研究團隊。要做本地推論、邊緣部署、或想在多模態決策任務上實驗的研究者,是它的目標使用者。
取得方式相對簡單,兩個模型都已放上 Hugging Face,Liquid AI 也提供在本機執行它們的文件。因為是開源權重,你可以自己下載、自己部署,不受特定雲端服務綁定,隱私與資料流向也由你掌控。
一般消費者則不太需要直接使用它。它不寫文章、不聊天,日常生活中的用途不直觀,除非你是拿它來支撐某個更上層的產品或服務。
目前的限制
有幾點要先講清楚。d1-omni-600M 是實驗性質的釋出,仍在積極開發,穩定度與功能都可能變動,不適合直接壓在正式產品上。
音訊的決策基準測試目前仍是一個未解的問題。Liquid AI 也坦言,針對音訊決策的專用評測還有待社群發展,這代表 d1-omni-600M 在音訊上的表現,一時還沒有標準可對照。
d1-3B 的視覺能力方面,Liquid AI 這次沒有公布私有的視覺分割分數,而是用它驗證保留了原骨幹的視覺能力。想要精確評測數字的人,得自己跑一遍。
結語
Liquid AI Open d1 打開的是決策模型這條相對小眾的路線。不生成文字、一次算完就給判斷,讓它在邊緣裝置上的即時性有明顯優勢,而開源權重也讓開發者能自由部署。
想動手的人可以直接到 Hugging Face 下載 d1-3B 或 d1-omni-600M,照官方文件在本機跑起來。先從一個簡單的分類任務試起,感受它與生成式模型在延遲與用法上的差別,會比讀規格更清楚。