
今年 7 月,阿正老師寫過一篇 Bonsai 27B 的介紹,當時最吸睛的賣點是「270 億參數塞進 3.9GB,連 iPhone 都跑得動」,國外媒體還把它稱作「裝置端 AI 的 DeepSeek 時刻」。兩個月後,開發商 PrismML 在 2026 年 9 月 17 日端出了第二代:Ternary Bonsai 2 27B。
這次的官方標題寫得很克制——「近乎無損的壓縮,體積只有九分之一」。重點從「小到誇張」變成「小而且真的沒變笨」:官方宣稱在 20 項推理基準上平均拿到 83.9 分,相當於原始 FP16 模型 85.4 分的 98.2%,而前一代的保留率是 95%。
不過阿正老師先把最容易誤會的一件事講清楚:官方把 iPhone 與 iPad 列在支援平台內,但目前沒有公布手機實測速度或最低記憶體需求。第二代的檔案比前一代更大,因此「官方支援」不代表每一台手機都能順暢執行。這篇就來拆解 Bonsai 2 更新了什麼、硬體門檻如何、三種下載格式該選哪一個,以及社群對官方數字有哪些保留意見。先聲明:本文為官方資料與第三方報導整理,阿正老師還沒有實際下載安裝與實測,文中出現的速度與分數都會標明來源。
文章目錄
一、Bonsai 2 27B 是什麼?跟前一代差在哪
先用一句話解釋:Bonsai 系列是把別人家的大模型「修剪」成盆栽的技術——保留枝幹形狀,體積砍到原本的一小塊。這一代的原料是阿里巴巴的 Qwen3.8-27B(約 273.6 億參數),經過三元量化之後,出廠時每個權重平均只佔 1.76 個位元,檔案從 FP16 的 53.8GB 縮到 5.93GB。
| 官方網站 | prismml.com/news/bonsai-2-27b(技術文件:docs.prismml.com) |
| 模型版本 | Ternary Bonsai 2 27B(2026-09-17 發布) |
| 基礎模型 | Qwen3.8-27B(約 273.6 億參數,支援文字與圖片輸入) |
| 檔案大小 | GGUF PTQ1_0:5.93GB/GGUF PQ2_0:7.25GB/MLX 2-bit:8.60GB(FP16 原始檔為 53.8GB) |
| 上下文長度 | 262,144 tokens(約 26 萬字元等級,採混合注意力架構) |
| 支援環境 | NVIDIA 顯卡(CUDA)、Apple 晶片 Mac(MLX)、瀏覽器 WebGPU 示範;GGUF 需 PrismML 版 llama.cpp |
| 繁體中文 | 待確認(基底 Qwen3.8 對中文一向不弱,但官方未公布任何繁中評測數據,建議自行測試) |
| 費用 | 免費,Apache 2.0 授權(可商用) |
| 模型下載 | [Hugging Face 官方模型集]/[GitHub 示範專案](AI 模型非安裝程式,本站下載站不收錄) |
跟前一代擺在一起看,差異會更清楚:
| 項目 | Bonsai 27B(第一代,2026-07) | Bonsai 2 27B(第二代,2026-09) |
|---|---|---|
| 基礎模型 | Qwen3.6-27B | Qwen3.8-27B |
| 主打賣點 | 體積極小,手機也塞得下 | 同樣約九分之一體積,但品質幾乎沒掉 |
| 最小檔案 | 1-bit 版 3.9GB;三元版 7.2GB | 三元版 5.93GB(無 1-bit 版) |
| 官方效能保留率 | 1-bit 版逾 90%、三元版約 95% | 98.2%(83.9/85.4) |
| 多模態 | 支援 | 支援(MLX 版另含未量化的視覺模組 0.92GB) |
| 官方主推硬體 | 手機、平板等裝置端 | NVIDIA GPU、Apple 晶片 Mac、iPhone 與 iPad |
二、更新重點一:換基底、換量化法,保留率從 95% 拉到 98.2%
第一代的招牌是 1-bit,也就是每個權重只剩「正」或「負」;第二代則全面走三元(ternary)路線——多了一個「零」的狀態,等於每個權重可以是 −1、0、+1 三選一。多這一個零看起來沒什麼,實際上對表達模型的細膩度差很多,這也是官方願意放棄「3.9GB」這個漂亮數字、把體積放寬到 5.93GB 的原因。

技術面還有兩個變化值得一提。第一是基底換成更新的 Qwen3.8-27B,本來起跑點就比較高;第二是模型採用混合注意力架構(官方說明約 75% 線性注意力、25% 完整注意力),搭配 SwiGLU、RoPE、RMSNorm 等現在常見的組件,把上下文長度撐到 262,144 tokens。對一般讀者來說,這句話的白話版是:可以一次丟進去很長的文件而不會馬上「忘記前面」。
三、更新重點二:官方分項成績拆解
整體平均只能看個大概,分項才看得出這次的壓縮「犧牲在哪裡」。以下是 PrismML 官方公布的六大類成績:
| 能力分類 | Bonsai 2 27B 官方分數 | 白話解讀 |
|---|---|---|
| 數學 | 96.57 | 幾乎沒受壓縮影響,是這次表現最好的一項 |
| 知識與推理 | 83.95 | 一般問答、常識推論的主力分數 |
| 指令遵循 | 82.66 | 官方指出這項壓縮後反而略高於原始模型 |
| 程式編寫 | 81.58 | 與原始模型差距約 0.5 分,損失很小 |
| 視覺 | 78.59 | 掉最多的一項(約 3 分),看圖任務要求高的人要留意 |
| 代理與工具呼叫 | 77.57 | 六項中絕對分數最低,也是社群最想驗證的一項 |
四、更新重點三:速度與硬體門檻,順便回答「手機還能跑嗎」
先講最多人問的那一題:PrismML 官方列明 Bonsai 2 27B 可透過 MLX 在 Mac、iPhone 與 iPad 上執行。不過官方目前公布的速度展示集中在 RTX 5090 與 M5 Max;第二代檔案從 5.93GB 起跳,MLX 版約 8.60GB,執行時還需要快取與暫存空間,因此實際能否順暢運作仍取決於裝置記憶體、散熱與核心支援。

官方與模型卡公布的速度數據整理如下(全部都是官方公布值,不是阿正老師實測):
| 硬體 | 官方公布生成速度 | 備註 |
|---|---|---|
| NVIDIA RTX 5090 | 約 143 tokens/秒 | 官方新聞稿的最高速度展示 |
| NVIDIA RTX 4090 | 未公布 tok/s | 官方改以耗電量呈現:每個 token 約 0.714 mWh |
| Apple M5 Max | 最高約 46.8 tokens/秒 | PrismML 官方新聞稿公布值 |
| Apple M5 Pro | 約 28.7 tokens/秒 | MLX 模型卡數據 |
| Apple M4 Pro | 約 18 tokens/秒 | MLX 模型卡列出的最入門機型 |
阿正老師手邊剛好有 RTX 5070 12GB 的桌機,以及三台 M4 Mac mini(兩台 24GB、一台 16GB)。從上面的數字推算,16GB 的 M4 Mac mini 要跑 8.6GB 的 MLX 版會相當緊繃(系統本身就要吃掉一部分記憶體),24GB 那兩台會舒服很多;顯卡這邊 12GB VRAM 對 5.93GB 的 GGUF 版則還有餘裕。不過這些都是紙上推算,等阿正老師實際裝起來跑過再補上真實數字。
五、三種格式怎麼選?GGUF、MLX 與 WebGPU
Hugging Face 上一次放了好幾個版本,名字看起來很像但用途差很多,這裡幫大家分清楚:
| 版本 | 大小 | 適合誰 | 注意事項 |
|---|---|---|---|
| GGUF(PTQ1_0) | 5.93GB | Windows/Linux+NVIDIA 顯卡,想要最小檔案 | 必須用 PrismML 版 llama.cpp |
| GGUF(PQ2_0) | 7.25GB | 同上,但常餵長篇文件 | 檔案較大,換來較快的提示詞處理 |
| MLX 2-bit | 8.60GB | Apple 晶片 Mac 使用者 | 可用原生 mlx-lm 或 LM Studio,不必換分支 |
| WebGPU 示範 | 線上 | 只是想先看看效果的人 | Hugging Face Spaces 社群示範,非完整體驗 |
六、想試試看該怎麼開始
如果你完全沒碰過本地 AI,阿正老師會建議不要拿這顆當第一顆模型——先看本站的 Ollama 教學或 LM Studio 教學,用圖形介面把流程跑順了再回來。不確定要用哪一套的話,本站也有 Ollama、LM Studio 與 Jan 的比較。
已經有本地 AI 經驗的朋友,可以照下面三條路擇一:
路線一:Mac 使用者(最輕鬆)
直接在 LM Studio 裡搜尋 MLX 版本下載,或用 mlx_lm.chat 在終端機開聊天視窗。這條路不用編譯、不用換分支,Apple 晶片的 Mac 建議優先走這邊。
路線二:官方示範專案(一鍵腳本)
把 PrismML-Eng/Bonsai-demo 抓下來,跑 ./setup.sh(Windows 用 .\setup.ps1)讓它自動處理相依套件與模型下載,再執行 ./scripts/start_llama_server.sh,就會在本機 8080 埠開一個相容 OpenAI API 的伺服器,附帶可以貼圖的網頁聊天介面。要注意這個專案的說明頁目前主要涵蓋 8B/4B/1.7B 等較小的 Bonsai 模型,27B 的用法請以 Hugging Face 模型卡與官方文件為準;另外模型倉庫在尚未完全公開前,需要 Hugging Face token 才抓得到。
路線三:只想先看一眼
Hugging Face Spaces 上有社群做的 WebGPU 示範,用瀏覽器就能感受一下,不用先下載好幾 GB。想看技術細節的話,官方也把白皮書 PDF 放在 GitHub 上。
七、優點與缺點
✅ 優點
- 官方保留率從 95% 提升到 98.2%,是這一代最實在的進步
- 5.93GB 讓 8GB VRAM 等級的顯卡也有機會跑 27B 模型
- 262K 上下文+看圖能力,長文件與截圖問答都涵蓋
- Apache 2.0 免費可商用,完全離線、資料不外流
- Mac 走 MLX 不必編譯,LM Studio 就能直接用
⚠️ 缺點
- GGUF 版綁定 PrismML 自家 llama.cpp 分支,一般版跑不動
- 體積比第一代大;官方雖列出手機支援,但尚無手機速度與最低規格實測
- 視覺分數是掉最多的一項,代理與工具呼叫絕對分數最低
- 官方兩處公布的基準組合不一致,引用時容易搞混
- 繁體中文表現官方沒有數據,要自己測
- 模型倉庫尚未完全公開,可能需要 Hugging Face token
八、注意事項:官方數據之外,社群的保留意見
這一段阿正老師覺得比分數表更重要。上面所有亮眼的數字,目前全部都出自 PrismML 自己,第三方獨立驗證還很少。
開源社群的 local-llm 專案在 GitHub 上開了一則討論串(Issue #479),直接對第二代的說法提出質疑。他們的理由來自實測第一代的經驗:當時官方的分數看起來領先,但放進整套代理任務測試後,「這個領先在整體測試層級站不住腳」,只有單一項目拉開差距。發起者因此提醒:廠商的基準平均從某個數字跳到另一個數字,跟代理任務實際跑完要多久、成功率多少,是兩回事。
另外,第三方模型評測站 benchlm.ai 目前把 Bonsai 2 27B 的綜合分數列為 51.5 分、在 233 個模型中排第 110 名,看起來跟官方的 83.9 落差很大——但要公平地說,該站也標明這顆模型目前只有 443 個評測欄位中的 21 個有可顯示的證據,資料太少,這個排名同樣不能直接當定論。兩邊數字打架,正好說明現在下結論都太早。
九、阿正老師的總結:誰該換、誰先觀望
Bonsai 2 27B 的意義,阿正老師覺得不在於「又更小了」,而在於它把「壓縮模型」從一個技術展示,往「可以拿來做事的工具」推了一步。第一代是讓大家驚呼「原來能塞進手機」,第二代則用較大的體積換取更高的能力保留率,而且官方仍列出 iPhone 與 iPad 支援。以實用角度看,這一代更值得關注,但手機上的速度與門檻仍需實測。
有 Apple 晶片 Mac(建議 24GB 以上統一記憶體)、想要一顆離線但夠聰明的模型
→ 直接裝 MLX 版。LM Studio 搜尋就能下載,不用編譯、不用換分支,是目前最省事的一條路。
有 8GB 以上 VRAM 的 NVIDIA 顯卡、不排斥自己編譯
→ 值得試 GGUF PTQ1_0 版。但請有心理準備要先把 PrismML 的 llama.cpp 分支編起來,不是下載完就能跑。
想在手機或平板上跑 AI
→ 可以嘗試,但要把它視為相容性測試。官方列出 iPhone 與 iPad 支援,尚未公布手機速度與最低規格;容量或記憶體有限時,也可參考 第一代 Bonsai 27B 的 1-bit 3.9GB 版本。
只是想有個 AI 可以聊天、查資料
→ 不用急著跟。雲端的 ChatGPT、Gemini、Claude 免費版就很夠用,等你有「資料不能外流」或「想完全離線」的需求時再回來。
盆栽長大了一點,但更像一棵真的樹
從 3.9GB 到 5.93GB,Bonsai 這次選擇犧牲一點「話題性」去換實用度,阿正老師個人覺得是對的方向。等這幾天把模型抓下來,在 RTX 5070 桌機和 M4 Mac mini 上都跑一輪之後,再回來補上真正的實測數字。
你有打算換這一顆嗎?還是覺得本地模型跑到 27B 已經超出需求了?
歡迎在下面留言跟阿正老師分享!









