Bonsai 2 27B 來了!27B 模型壓到 5.9GB、效能保留 98.2%,官方支援 iPhone/iPad 但實際門檻待測

0
74 人次


Bonsai 2 27B 來了!27B 模型壓到 5.9GB、效能保留 98.2%,官方支援 iPhone/iPad 但實際門檻待測

今年 7 月,阿正老師寫過一篇 Bonsai 27B 的介紹,當時最吸睛的賣點是「270 億參數塞進 3.9GB,連 iPhone 都跑得動」,國外媒體還把它稱作「裝置端 AI 的 DeepSeek 時刻」。兩個月後,開發商 PrismML 在 2026 年 9 月 17 日端出了第二代:Ternary Bonsai 2 27B

這次的官方標題寫得很克制——「近乎無損的壓縮,體積只有九分之一」。重點從「小到誇張」變成「小而且真的沒變笨」:官方宣稱在 20 項推理基準上平均拿到 83.9 分,相當於原始 FP16 模型 85.4 分的 98.2%,而前一代的保留率是 95%。

不過阿正老師先把最容易誤會的一件事講清楚:官方把 iPhone 與 iPad 列在支援平台內,但目前沒有公布手機實測速度或最低記憶體需求。第二代的檔案比前一代更大,因此「官方支援」不代表每一台手機都能順暢執行。這篇就來拆解 Bonsai 2 更新了什麼、硬體門檻如何、三種下載格式該選哪一個,以及社群對官方數字有哪些保留意見。先聲明:本文為官方資料與第三方報導整理,阿正老師還沒有實際下載安裝與實測,文中出現的速度與分數都會標明來源。



一、Bonsai 2 27B 是什麼?跟前一代差在哪

先用一句話解釋:Bonsai 系列是把別人家的大模型「修剪」成盆栽的技術——保留枝幹形狀,體積砍到原本的一小塊。這一代的原料是阿里巴巴的 Qwen3.8-27B(約 273.6 億參數),經過三元量化之後,出廠時每個權重平均只佔 1.76 個位元,檔案從 FP16 的 53.8GB 縮到 5.93GB

image_3A26A35B

官方網站 prismml.com/news/bonsai-2-27b(技術文件:docs.prismml.com
模型版本 Ternary Bonsai 2 27B(2026-09-17 發布)
基礎模型 Qwen3.8-27B(約 273.6 億參數,支援文字與圖片輸入)
檔案大小 GGUF PTQ1_0:5.93GB/GGUF PQ2_0:7.25GB/MLX 2-bit:8.60GB(FP16 原始檔為 53.8GB)
上下文長度 262,144 tokens(約 26 萬字元等級,採混合注意力架構)
支援環境 NVIDIA 顯卡(CUDA)、Apple 晶片 Mac(MLX)、瀏覽器 WebGPU 示範;GGUF 需 PrismML 版 llama.cpp
繁體中文 待確認(基底 Qwen3.8 對中文一向不弱,但官方未公布任何繁中評測數據,建議自行測試)
費用 免費,Apache 2.0 授權(可商用)
模型下載 [Hugging Face 官方模型集]/[GitHub 示範專案](AI 模型非安裝程式,本站下載站不收錄)

跟前一代擺在一起看,差異會更清楚:

項目 Bonsai 27B(第一代,2026-07) Bonsai 2 27B(第二代,2026-09)
基礎模型 Qwen3.6-27B Qwen3.8-27B
主打賣點 體積極小,手機也塞得下 同樣約九分之一體積,但品質幾乎沒掉
最小檔案 1-bit 版 3.9GB;三元版 7.2GB 三元版 5.93GB(無 1-bit 版)
官方效能保留率 1-bit 版逾 90%、三元版約 95% 98.2%(83.9/85.4)
多模態 支援 支援(MLX 版另含未量化的視覺模組 0.92GB)
官方主推硬體 手機、平板等裝置端 NVIDIA GPU、Apple 晶片 Mac、iPhone 與 iPad
阿正老師點評:第一代是「表演給你看,原來可以壓這麼小」;第二代則是「壓小之後真的能用」。對想在自己電腦上養一顆本地模型的人來說,第二代才是比較實際的選擇。

二、更新重點一:換基底、換量化法,保留率從 95% 拉到 98.2%

第一代的招牌是 1-bit,也就是每個權重只剩「正」或「負」;第二代則全面走三元(ternary)路線——多了一個「零」的狀態,等於每個權重可以是 −1、0、+1 三選一。多這一個零看起來沒什麼,實際上對表達模型的細膩度差很多,這也是官方願意放棄「3.9GB」這個漂亮數字、把體積放寬到 5.93GB 的原因。

Bonsai 2 27B 三元量化與模型大小比較
三元量化將權重表示為負一、零與正一,使 27B 模型縮至約 5.9GB,同時保留官方所稱的 98.2% 整體基準表現。

技術面還有兩個變化值得一提。第一是基底換成更新的 Qwen3.8-27B,本來起跑點就比較高;第二是模型採用混合注意力架構(官方說明約 75% 線性注意力、25% 完整注意力),搭配 SwiGLU、RoPE、RMSNorm 等現在常見的組件,把上下文長度撐到 262,144 tokens。對一般讀者來說,這句話的白話版是:可以一次丟進去很長的文件而不會馬上「忘記前面」

⚠️ 官方在兩個地方公布的數字略有不同:新聞頁與技術文件寫的是「20 項推理基準平均 83.9,對照 FP16 的 85.4」,Hugging Face 模型卡則寫「14 項思考模式基準平均 84.78,對照 86.32」。兩組算出來的保留率都是 98.2%,但基準組合不同,引用時記得註明是哪一組。

三、更新重點二:官方分項成績拆解

整體平均只能看個大概,分項才看得出這次的壓縮「犧牲在哪裡」。以下是 PrismML 官方公布的六大類成績:

能力分類 Bonsai 2 27B 官方分數 白話解讀
數學 96.57 幾乎沒受壓縮影響,是這次表現最好的一項
知識與推理 83.95 一般問答、常識推論的主力分數
指令遵循 82.66 官方指出這項壓縮後反而略高於原始模型
程式編寫 81.58 與原始模型差距約 0.5 分,損失很小
視覺 78.59 掉最多的一項(約 3 分),看圖任務要求高的人要留意
代理與工具呼叫 77.57 六項中絕對分數最低,也是社群最想驗證的一項
阿正老師點評:這張表最有價值的資訊其實是「哪裡掉分」。數學和程式幾乎沒事,代表拿來當寫程式的副手很合理;視覺掉最多、代理分數最低,所以如果你的用途是「讓 AI 自己開工具跑一長串任務」,建議測試時多觀察它會不會中途走鐘。

四、更新重點三:速度與硬體門檻,順便回答「手機還能跑嗎」

先講最多人問的那一題:PrismML 官方列明 Bonsai 2 27B 可透過 MLX 在 Mac、iPhone 與 iPad 上執行。不過官方目前公布的速度展示集中在 RTX 5090 與 M5 Max;第二代檔案從 5.93GB 起跳,MLX 版約 8.60GB,執行時還需要快取與暫存空間,因此實際能否順暢運作仍取決於裝置記憶體、散熱與核心支援。

Bonsai 2 27B 在 NVIDIA 顯卡、Apple 晶片與行動裝置上的支援與門檻
官方列出 NVIDIA GPU、Mac、iPhone 與 iPad 支援;檔案大小不等於執行所需記憶體,實際表現仍須依裝置測試。
⚠️ PrismML 官方新聞稿明確把 iPhone、iPad 列入 MLX 支援平台,但目前仍沒有公布手機實測速度、支援機型清單或最低記憶體門檻。因此手機端的相容性與實際體驗仍需要自行測試;若裝置容量有限,前一代 3.9GB 的 1-bit 版本仍較容易嘗試。

官方與模型卡公布的速度數據整理如下(全部都是官方公布值,不是阿正老師實測):

硬體 官方公布生成速度 備註
NVIDIA RTX 5090 約 143 tokens/秒 官方新聞稿的最高速度展示
NVIDIA RTX 4090 未公布 tok/s 官方改以耗電量呈現:每個 token 約 0.714 mWh
Apple M5 Max 最高約 46.8 tokens/秒 PrismML 官方新聞稿公布值
Apple M5 Pro 約 28.7 tokens/秒 MLX 模型卡數據
Apple M4 Pro 約 18 tokens/秒 MLX 模型卡列出的最入門機型

阿正老師手邊剛好有 RTX 5070 12GB 的桌機,以及三台 M4 Mac mini(兩台 24GB、一台 16GB)。從上面的數字推算,16GB 的 M4 Mac mini 要跑 8.6GB 的 MLX 版會相當緊繃(系統本身就要吃掉一部分記憶體),24GB 那兩台會舒服很多;顯卡這邊 12GB VRAM 對 5.93GB 的 GGUF 版則還有餘裕。不過這些都是紙上推算,等阿正老師實際裝起來跑過再補上真實數字。


五、三種格式怎麼選?GGUF、MLX 與 WebGPU

Hugging Face 上一次放了好幾個版本,名字看起來很像但用途差很多,這裡幫大家分清楚:

image_73E5C09C

版本 大小 適合誰 注意事項
GGUF(PTQ1_0) 5.93GB Windows/Linux+NVIDIA 顯卡,想要最小檔案 必須用 PrismML 版 llama.cpp
GGUF(PQ2_0) 7.25GB 同上,但常餵長篇文件 檔案較大,換來較快的提示詞處理
MLX 2-bit 8.60GB Apple 晶片 Mac 使用者 可用原生 mlx-lm 或 LM Studio,不必換分支
WebGPU 示範 線上 只是想先看看效果的人 Hugging Face Spaces 社群示範,非完整體驗
⚠️ 這點最容易踩雷:兩個 GGUF 版本都不能用一般的 llama.cpp 執行。官方說明這批權重需要在執行期做 Walsh–Hadamard 轉換,而這段程式碼還沒有併回官方主線,所以標準版 llama.cpp 要嘛直接拒絕載入、要嘛跑出一堆亂碼。想用 GGUF 就得去 PrismML 的 llama.cpp 分支自己編譯。相對地,Mac 的 MLX 版沒有這個包袱。

六、想試試看該怎麼開始

如果你完全沒碰過本地 AI,阿正老師會建議不要拿這顆當第一顆模型——先看本站的 Ollama 教學LM Studio 教學,用圖形介面把流程跑順了再回來。不確定要用哪一套的話,本站也有 Ollama、LM Studio 與 Jan 的比較

image_55D28464

已經有本地 AI 經驗的朋友,可以照下面三條路擇一:

路線一:Mac 使用者(最輕鬆)

直接在 LM Studio 裡搜尋 MLX 版本下載,或用 mlx_lm.chat 在終端機開聊天視窗。這條路不用編譯、不用換分支,Apple 晶片的 Mac 建議優先走這邊。

路線二:官方示範專案(一鍵腳本)

PrismML-Eng/Bonsai-demo 抓下來,跑 ./setup.sh(Windows 用 .\setup.ps1)讓它自動處理相依套件與模型下載,再執行 ./scripts/start_llama_server.sh,就會在本機 8080 埠開一個相容 OpenAI API 的伺服器,附帶可以貼圖的網頁聊天介面。要注意這個專案的說明頁目前主要涵蓋 8B/4B/1.7B 等較小的 Bonsai 模型,27B 的用法請以 Hugging Face 模型卡與官方文件為準;另外模型倉庫在尚未完全公開前,需要 Hugging Face token 才抓得到。

路線三:只想先看一眼

Hugging Face Spaces 上有社群做的 WebGPU 示範,用瀏覽器就能感受一下,不用先下載好幾 GB。想看技術細節的話,官方也把白皮書 PDF 放在 GitHub 上。

好消息是授權沿用 Apache 2.0,跟第一代一樣可以自由商用。學校要在校內架一台離線問答機、或是工作室想做不外流的資料處理,授權面不會卡住。

七、優點與缺點

✅ 優點

  • 官方保留率從 95% 提升到 98.2%,是這一代最實在的進步
  • 5.93GB 讓 8GB VRAM 等級的顯卡也有機會跑 27B 模型
  • 262K 上下文+看圖能力,長文件與截圖問答都涵蓋
  • Apache 2.0 免費可商用,完全離線、資料不外流
  • Mac 走 MLX 不必編譯,LM Studio 就能直接用

⚠️ 缺點

  • GGUF 版綁定 PrismML 自家 llama.cpp 分支,一般版跑不動
  • 體積比第一代大;官方雖列出手機支援,但尚無手機速度與最低規格實測
  • 視覺分數是掉最多的一項,代理與工具呼叫絕對分數最低
  • 官方兩處公布的基準組合不一致,引用時容易搞混
  • 繁體中文表現官方沒有數據,要自己測
  • 模型倉庫尚未完全公開,可能需要 Hugging Face token


八、注意事項:官方數據之外,社群的保留意見

這一段阿正老師覺得比分數表更重要。上面所有亮眼的數字,目前全部都出自 PrismML 自己,第三方獨立驗證還很少。

開源社群的 local-llm 專案在 GitHub 上開了一則討論串(Issue #479),直接對第二代的說法提出質疑。他們的理由來自實測第一代的經驗:當時官方的分數看起來領先,但放進整套代理任務測試後,「這個領先在整體測試層級站不住腳」,只有單一項目拉開差距。發起者因此提醒:廠商的基準平均從某個數字跳到另一個數字,跟代理任務實際跑完要多久、成功率多少,是兩回事

另外,第三方模型評測站 benchlm.ai 目前把 Bonsai 2 27B 的綜合分數列為 51.5 分、在 233 個模型中排第 110 名,看起來跟官方的 83.9 落差很大——但要公平地說,該站也標明這顆模型目前只有 443 個評測欄位中的 21 個有可顯示的證據,資料太少,這個排名同樣不能直接當定論。兩邊數字打架,正好說明現在下結論都太早。

⚠️ 阿正老師的建議:把官方分數當成「值得一試的理由」,不要當成「已經驗證的結論」。真的要用在工作流程上,請拿自己的實際任務測一輪——建議測試時可以觀察三件事:繁體中文回答會不會夾雜簡體或英文、長文件讀到後段會不會失焦、以及叫它連續呼叫工具時會不會中途放棄。

九、阿正老師的總結:誰該換、誰先觀望

Bonsai 2 27B 的意義,阿正老師覺得不在於「又更小了」,而在於它把「壓縮模型」從一個技術展示,往「可以拿來做事的工具」推了一步。第一代是讓大家驚呼「原來能塞進手機」,第二代則用較大的體積換取更高的能力保留率,而且官方仍列出 iPhone 與 iPad 支援。以實用角度看,這一代更值得關注,但手機上的速度與門檻仍需實測。

有 Apple 晶片 Mac(建議 24GB 以上統一記憶體)、想要一顆離線但夠聰明的模型

直接裝 MLX 版。LM Studio 搜尋就能下載,不用編譯、不用換分支,是目前最省事的一條路。

有 8GB 以上 VRAM 的 NVIDIA 顯卡、不排斥自己編譯

值得試 GGUF PTQ1_0 版。但請有心理準備要先把 PrismML 的 llama.cpp 分支編起來,不是下載完就能跑。

想在手機或平板上跑 AI

可以嘗試,但要把它視為相容性測試。官方列出 iPhone 與 iPad 支援,尚未公布手機速度與最低規格;容量或記憶體有限時,也可參考 第一代 Bonsai 27B 的 1-bit 3.9GB 版本。

只是想有個 AI 可以聊天、查資料

不用急著跟。雲端的 ChatGPT、Gemini、Claude 免費版就很夠用,等你有「資料不能外流」或「想完全離線」的需求時再回來。


盆栽長大了一點,但更像一棵真的樹

從 3.9GB 到 5.93GB,Bonsai 這次選擇犧牲一點「話題性」去換實用度,阿正老師個人覺得是對的方向。等這幾天把模型抓下來,在 RTX 5070 桌機和 M4 Mac mini 上都跑一輪之後,再回來補上真正的實測數字。

你有打算換這一顆嗎?還是覺得本地模型跑到 27B 已經超出需求了?

歡迎在下面留言跟阿正老師分享!

留下回覆

請輸入你的評論!
請在這裡輸入你的名字