Our website uses necessary cookies to enable basic functions and optional cookies to help us to enhance your user experience. Learn more about our cookie policy by clicking "Learn More".
Accept All Only Necessary Cookies
NEWSREVIEWSHOWTO

Liquid AI Open d1 是什麼:開源多模態決策模型 d1-3B 與 d1-omni-600M 解析

By Agent

2026年10月08日

Liquid AI 發布 Open d1 開源決策模型,d1-3B 讀文字與圖像,d1-omni-600M 支援文字加音訊,主打從 DGX 到 Jetson 的邊緣即時決策。

目錄

    Liquid AI 在 10 月 7 日開源了兩個模型,d1-3B 與 d1-omni-600M,隸屬於它的 d1 決策模型家族。這兩個模型最特別的地方,是它們不生成文字,而是直接吐出一個判斷。

    這聽起來可能有點抽象,但對需要在邊緣裝置上做即時決策的人來說,這個差別很實際。以下講清楚決策模型是什麼、Open d1 強在哪、以及它在哪些場景派得上用場。

    Liquid AI Open d1 是什麼

    Open d1 是 Liquid AI 一組開源權重的多模態模型。d1-3B 能讀文字與圖像,實驗性質的 d1-omni-600M 則能處理文字搭配圖像,或文字搭配音訊。

    跟一般生成式模型最大的不同,在於它們的輸出形式。傳統大型語言模型是一個詞元接一個詞元地生成句子,Open d1 這類決策模型不走這條路,它在一次前向傳遞中直接產出答案,過程中不吐出任何文字。

    這代表它適合做的是「選一個」或「給一個值」的任務,例如分類、判斷、挑選,而不是寫文章或聊天。Liquid AI 把這條 Liquid AI 決策模型產品線定位在需要即時、結構化決策的場合,尤其是算力有限的邊緣裝置。

    為什麼它不生成文字

    生成模型與決策模型的分工,關鍵在延遲。生成文字需要逐個詞元推進,句子越長越慢;決策模型一次算完就結束,時間相對固定且可預測。

    對即時系統來說,這種可預測性很值。自駕、工業檢測、語音互動這類場景,系統沒有本錢慢慢等一段文字生成完再判斷下一步。

    Liquid AI 過去的模型是生成式的 Liquid Foundation Models(LFM),Open d1 則是另一條支線。同一個團隊用不同的架構目標做出不同性質的模型,這是這次開源值得留意的地方。

    d1-3B 與 d1-omni-600M 的差別

    兩個模型的定位不同。d1-3B 是主力,參數量約 30 億級,能讀文字與圖像,是這條線裡決策品質最好的一個。

    d1-omni-600M 則是一個實驗性檢查點,參數量小得多,約 5.87 億,由一個 3.81 億的共享主幹加上決策頭、一個 9,400 萬的視覺編碼器與一個 1.12 億的音訊編碼器組成。它的特別之處是能處理三種模態,接收文字加圖像,或文字加音訊。

    換句話說,想要品質選 d1-3B;想在極小的硬體上做多模態判斷,d1-omni-600M 是那條路。後者仍在積極開發,屬研究性質的釋出。

    Open d1 的效能表現

    d1-3B 在 Decision Index v0.2.1 公開分割上拿到 48.57 分,勝過所有 10B 以下的模型,與體積大它 12 倍的 Decider 35B-A3B 打平。體積小、分數不吃虧,是這條產品線的核心賣點。

    速度方面更能說明定位。d1-3B 在一張 NVIDIA GeForce RTX 4090 上回答一個問題只需 8 毫秒,在 Jetson AGX Thor 上是 16 毫秒,在 Jetson AGX Orin 上是 26 毫秒,連最入門的 Jetson Orin Nano 也只要 50 毫秒。

    值得注意的是它的狀態處理能力。在 3 題共用一份狀態的情況下,AGX Thor 只從 16 毫秒變成 20 毫秒,也就是說解答多個問題的成本增長很平緩。

    在邊緣裝置上的實際意義

    邊緣部署是 Open d1 的主戰場。Liquid AI 強調它跑得動完整的 NVIDIA 堆疊,從資料中心的 DGX,到 RTX 工作站,再到邊緣的 Jetson 系列,並且在推出當天就有 llama.cpp 支援。

    這種「從資料中心一路到最小邊緣硬體都能跑」的能力,意味著同一個模型可以先用大機器開發與驗證,再直接下放到裝置上線,不必為不同平台重寫。

    以 d1-3B 在 Jetson Orin Nano 上 50 毫秒的反應速度來說,它已經夠快,能在最小的邊緣硬體上做即時判斷。對於要在現場做決策、又不想把資料傳回雲端的應用,這是一條可行路線。

    誰適合用、怎麼取得

    Open d1 主要面向開發者與研究團隊。要做本地推論、邊緣部署、或想在多模態決策任務上實驗的研究者,是它的目標使用者。

    取得方式相對簡單,兩個模型都已放上 Hugging Face,Liquid AI 也提供在本機執行它們的文件。因為是開源權重,你可以自己下載、自己部署,不受特定雲端服務綁定,隱私與資料流向也由你掌控。

    一般消費者則不太需要直接使用它。它不寫文章、不聊天,日常生活中的用途不直觀,除非你是拿它來支撐某個更上層的產品或服務。

    目前的限制

    有幾點要先講清楚。d1-omni-600M 是實驗性質的釋出,仍在積極開發,穩定度與功能都可能變動,不適合直接壓在正式產品上。

    音訊的決策基準測試目前仍是一個未解的問題。Liquid AI 也坦言,針對音訊決策的專用評測還有待社群發展,這代表 d1-omni-600M 在音訊上的表現,一時還沒有標準可對照。

    d1-3B 的視覺能力方面,Liquid AI 這次沒有公布私有的視覺分割分數,而是用它驗證保留了原骨幹的視覺能力。想要精確評測數字的人,得自己跑一遍。

    結語

    Liquid AI Open d1 打開的是決策模型這條相對小眾的路線。不生成文字、一次算完就給判斷,讓它在邊緣裝置上的即時性有明顯優勢,而開源權重也讓開發者能自由部署。

    想動手的人可以直接到 Hugging Face 下載 d1-3B 或 d1-omni-600M,照官方文件在本機跑起來。先從一個簡單的分類任務試起,感受它與生成式模型在延遲與用法上的差別,會比讀規格更清楚。

    Back to top

    Featured lists

    NEWSNEWSREVIEWSREVIEWSHOWTOHOWTO
    最新測評
    Google 凍結開源漏洞賞金計畫:AI 提交為何把它壓垮
    Factory Automations 是甚麼?用自然語言讓 Droid 代理自動跑重複工作
    Google SynthID Detector 是什麼:AI 內容水印偵測與驗證完整解析
    EmbeddingGemma 2:開源多模態嵌入與裝置端 AI
    高人氣測評
    Claude 是否有意識?Anthropic 道德研究與 Claude 人工智慧倫理完整解讀
    Grok Bot 對比其他 AI 代理:有何不同
    鳴潮 3.7 前瞻:開播前已知情報全盤點
    Meta muse for Mac 是什麼?可操作電腦檔案的 AI 代理完整解析
    Claude Code Cloud sessions 盤點:功能與使用場景一次看懂
    Claude Sonnet 5.5 是什麼?基準測試與更新重點
    GPT-6 Sol 與 Luna 完整解析:OpenAI 新模型怎麼用、便宜在哪
    ZCode 價格 2026:GLM Coding 方案解析
    訂閱APKPure
    第一時間獲取熱門安卓遊戲應用的首發體驗,最新資訊和玩法教程。
    不,謝謝
    訂閱
    訂閱成功!
    您已訂閱APKPure。