EmbeddingGemma 2:開源多模態嵌入與裝置端 AI
2026年10月08日
Google DeepMind 在 10 月 6 日發布 EmbeddingGemma 2,一款 740M 參數的開源嵌入模型,採 Apache 2.0 授權。它最特別的地方,是把文字、程式碼、圖片、影片與音訊全部塞進同一個 768 維向量空間。對想在手機上做搜尋、又不把資料送上雲端的人,這是一個關鍵進展。
Google DeepMind 在 10 月 6 日發布 EmbeddingGemma 2,一款 740M 參數的開源嵌入模型,採 Apache 2.0 授權。它最特別的地方,是把文字、程式碼、圖片、影片與音訊全部塞進同一個 768 維向量空間。對想在手機上做搜尋、又不把資料送上雲端的人,這是一個關鍵進展。
這篇文章拆解嵌入模型的概念、EmbeddingGemma 2 的多模態能力、裝置端 AI 的實際用途,以及導入前要衡量的事。
EmbeddingGemma 2 與嵌入模型是什麼
嵌入模型的工作,是把一段內容轉換成一串數字,也就是向量。語意相近的內容,轉出來的向量在空間裡也靠得近。
這聽起來抽象,但它支撐了你每天用的搜尋與推薦。當你在相簿裡打「海邊」就跳出沙灘照片,背後就是嵌入模型在比對語意,而不是比對檔名。
EmbeddingGemma 2 的突破,在於把不同型態的內容放進「同一個」向量空間。文字查詢、一張圖、一段錄音,都可以被轉成同一套座標系統裡的點,彼此比較。這也是「多模態」這三個字的實際含義。
上一代 EmbeddingGemma 已經有超過兩千萬次下載,社群基礎不小。第二代保留了原本的強項,再把範圍擴到影像與聲音。
理解它的價值,可以把向量想像成座標。傳統搜尋只看得懂字面,嵌入模型則看得懂意思,哪怕你用的詞跟文件裡的不一樣,也能找到。
這種「懂意思」的能力,也是近年檢索技術改善的核心。把搜尋從關鍵字比對推進到語意比對,結果往往更貼近使用者真正想要的。
740M 參數如何做到裝置端 AI
740M 參數在今天的模型裡算小。小的好處是跑得動,也能塞進手機的記憶體裡。
官方數據指出,在 Pixel 11 Pro 上量化後,純文字版本的權重只需要約 191MB 主動記憶體,完整多模態版本約 567MB。這組數字讓它能在不依賴雲端的情況下完成推論。
它還用了一個叫 Matryoshka 表示學習的技術,可以把輸出向量從 768 維動態截短到 512、256 或 128 維。維度越低,佔的儲存空間越小,最多能省下六倍。手機儲存空間有限,這種彈性很實際。
上下文視窗也擴到 8K 詞元,比第一代大四倍,足以一次處理幾分鐘的音訊或數十張圖,維持裝置端運作的可行性。
模組化設計也讓它可以依需求伸縮:純文字場景只需 270M 參數,要加視覺再加 170M,要加音訊再加 300M。這種堆疊式結構,讓開發者不必為用不到的能力付代價,也更容易在有限的裝置資源上做出取捨。
多模態嵌入在手機上的實際用途
最直接的場景是相簿搜尋。你可以用一句話找出某段影片,或用一段文字查詢翻遍好幾小時的錄音。因為模型同時懂畫面與聲音,跨型態搜尋才有可能。
另一個用途是離線的檢索增強生成。把重要文件在裝置上先轉成向量,之後提問時直接比對,不必把內容傳到伺服器。對在意隱私、或網路不穩的場合,這種做法能同時解決兩個問題。
還有一個容易被忽略的場景,是本機程式碼索引。EmbeddingGemma 2 在程式碼基準測試上的成績,比前一代大幅提升。對開發者來說,這代表在本機就能建立語意化的程式碼搜尋,找那段「記得寫過但忘了在哪」的邏輯會快得多。
對一般用戶,這些能力最終會被包進 App 裡。你在相簿或筆記軟體裡打到什麼,就往什麼方向搜,背後的技術就是它。
它還有一個實際好處:因為不靠網路,搜尋反應更快,也不再受限於伺服器的排隊與延遲。
對於需要處理敏感資料的行業,例如醫療或法律,這種完全在本地完成的搜尋尤其有意義。資料不離開裝置,合規上的顧慮也少了一層。
開源 Apache 2.0 授權的意義
EmbeddingGemma 2 採 Apache 2.0 授權,這是商業上相對寬鬆的條款。企業可以把它整合進自家產品,修改後再散布,通常不必開源自己的程式碼。
這對想控制成本與資料流向的團隊很重要。閉源嵌入服務按用量計費,長期下來不便宜;開源模型則是一次取得,之後的成本主要是自己維運的硬體與人力。
但寬鬆授權不等於零責任。你仍要自行確保使用方式符合法規,也要為部署後的效能與安全負責。授權解決的是能不能用的問題,不是怎麼用才安全。
對新創而言,這種授權能讓產品在早期先省下一筆雲端費用,把資源留到真正需要的地方。
對研究者也友善:可以自由比較、微調與發表結果,不用綁在一家廠商的服務條款上。這種可檢查、可重複的特性,也是開源模型在學術與工程圈受歡迎的原因。
導入裝置端 AI 要先想清楚的事
把自己的 AI 跑在裝置上,聽起來很美,實際導入有幾道門檻。
硬體相容性是第一關。不同手機的晶片與記憶體差異很大,能在高階機跑得順的模型,在入門機上未必撐得住。要覆蓋的機型越廣,調校的工夫越多。
維護成本是第二關。雲端服務出問題,供應商會處理;模型跑在用戶裝置上,出錯就是你的責任。版本更新、相容性測試、異常回報,都要自己扛。
還有品質取捨。小模型再怎麼優化,終究有極限;在需要極高準確度的場合,雲端的大模型仍有優勢。務實的做法,是讓裝置端處理隱私敏感與需要即時回應的任務,把複雜的推上去。
最後是評估基準。裝置端模型不能只看跑分,要看它在真實內容上的表現。用你自己場景裡的資料測試,比看公開榜單更能反映上線後的效果。
落地時建議先從單一功能開始,例如相簿搜尋或本機文件檢索,驗證通了再擴大。一次把所有搜尋換成裝置端,風險太高。
同時也要想清楚退路:萬一裝置端效果不理想,能不能回退到雲端版本。預留這道開關,會讓導入的決策輕鬆很多。
最後是評估基準。裝置端模型不能只看跑分,要看它在真實內容上的表現。用你自己場景裡的資料測試,比看公開榜單更能反映上線後的效果。
結語
EmbeddingGemma 2 把文字、圖像、音訊與影片統一進一個向量空間,又靠 740M 的小體積實現裝置端推論,配合 Apache 2.0 授權,替離線搜尋與隱私優先的應用開了一條路。它不會一夜之間改變你手機裡的每款 App,但會慢慢滲進搜尋與推薦的底層。
對開發者而言,接下來的觀察點是社群工具的成熟度。當主流框架都支援這類模型,導入門檻會快速下降,裝置端 AI 也會從炫技變成標配。
想自己動手的人,可以從官方文件取得模型權重與工具,下載時確認來源與授權條款,並保留版本記錄。
它的意義不只是又多一個開源模型,而是把「資料不上雲也能搜」這件事,從概念變成手機當場跑得動的現實。對開發者社群來說,這樣的模型累積越多,可選的組合就越豐富。
也因為它是完全開放的,其他團隊可以在它之上做微調、建立新應用,這種乘數效應比單一產品更能推動整個領域往前走。
回到使用者層面,最直接的感受就是搜尋變聰明、隱私更可控、反應更即時。這三件事都不張揚,卻實實在在地改變使用感受。
裝置端 AI 的價值在於把資料留在自己手上,而要把這份價值用好,靠的是對硬體與品質的務實評估,不是模型本身的參數數字。