
這幾個月開源 AI 的大新聞幾乎都在比「誰的參數多」:兆級參數滿天飛,看起來很威風,但對一般人來說有個很現實的問題——那些模型根本塞不進自己的電腦。
所以阿里巴巴 Qwen 團隊 2026 年 8 月中開源的 Qwen3.8-27B 特別值得聊:它只有 270 億參數(27B),是一般顯示卡跑得動的尺寸,卻是原生多模態(看得懂圖片)、有 262K 的超長上下文,而且採用最寬鬆的 Apache 2.0 授權,商用也沒問題。
先前阿正老師介紹過同門的旗艦款 Qwen3.8-Max(2.4 兆參數),那台是「雲端猛獸」;這次的 27B 則是「能牽回家養的」。這篇就來看看它到底強在哪、一般人怎麼免費玩到。
一、Qwen3.8-27B 是什麼?重點規格一次看
Qwen3.8-27B 是阿里巴巴 Qwen 團隊在 2026 年 8 月中釋出的開放權重模型(官方 ModelScope 標記為 8/14,Hugging Face 幾乎同時上架)。它屬於 dense(稠密)架構,也就是每次推論全部參數都會動起來,不像 MoE 那樣只叫醒一部分「專家」——好處是行為穩定、部署單純,適合塞進單張顯示卡。
| 官方網站 | https://chat.qwen.ai/(Qwen Chat 免費網頁版) |
| 模型權重 | Hugging Face(Qwen3.8 Collection)、ModelScope |
| 最新版本 | Qwen3.8-27B(發布日期 2026-08-14) |
| 參數量 | 270 億(27B)dense,原生多模態(文字+視覺) |
| 上下文長度 | 原生 262K tokens,可用 YaRN 延伸至約 1M |
| 授權/費用 | Apache 2.0,免費下載、可商用;雲端 API 依 Qwen Cloud/阿里雲百鍊計價 |
| 中文支援 | ✅ 中文能力向來是 Qwen 家族強項;繁體中文可正常對話,但輸出偶爾夾雜簡體用語,建議在提示中指定「繁體中文、台灣用語」 |
| 軟體下載 | [LM Studio本站下載點] |
二、四個最有感的特色

✅ 優點
- 原生看得懂圖片:不是外掛一個辨識模組,而是文字與視覺一起訓練,丟截圖問問題、讀表格都行
- 262K 超長上下文:整份合約、整個專案的程式碼一次讀完
- 官方稱在寫程式與辦公室情境上整體表現超越自家的 Qwen3.7-Plus
- Apache 2.0 完全開放,可自由微調、商用部署
- 單張 24GB 顯示卡(量化後)就跑得動
⚠️ 缺點
- 27B 終究不是旗艦,複雜推理仍不及 Qwen3.8-Max 或閉源大模型
- 要吃到 262K 上下文,記憶體需求會暴增,一般顯示卡實際能開的長度有限
- 視覺功能需另外載入 mmproj 檔(約 0.9GB),設定比純文字模型麻煩
- 官方跑分多為英文基準,繁體中文表現需自行測試
- 12GB 顯示卡想跑,得用更低量化或分卸到 CPU,速度會明顯變慢
架構上,Qwen3.8-27B 採用 64 層 transformer,以 3:1 的比例混搭 Gated DeltaNet(線性注意力)與 Gated Full Attention,並內建 multi-token prediction 做推測解碼——白話說就是用比較省的方式處理長文,並且一次多猜幾個字加速輸出。
三、免費試用:不用顯示卡也能玩
沒有好顯卡也想試?最快的方式是直接開 Qwen Chat(chat.qwen.ai)網頁版,免費註冊就能用,介面支援中文,可以直接上傳圖片提問。至於網頁版當下實際掛的是哪一顆模型、能不能手動指定 Qwen3.8-27B,各地區與時間點可能不同,進去看模型下拉選單最準。
另外兩條路:
- Hugging Face 線上試玩:模型頁面常會附 Spaces demo,開瀏覽器就能對話
- 雲端 API:透過 Qwen Cloud 或阿里雲百鍊接 API,適合開發者,依用量計費
四、想跑在自己電腦?硬體需求與方法
Qwen3.8-27B 的原始權重是 BF16,檔案很大,一般人會用量化版(把精度壓低換取體積縮小)。目前社群最常見的建議是 Q4_K_M 這一級:下載體積約 18GB 上下,官方以外的整理指出約 17GB 以上顯示記憶體就有機會跑起來,因此 24GB 顯卡是比較保險的門檻。
| 執行方式 | 難易度 | 適合誰 | 備註 |
|---|---|---|---|
| LM Studio | ★☆☆ 最簡單 | 不想打指令的一般用戶 | 圖形介面搜尋、下載、聊天一站完成 |
| Ollama | ★★☆ | 習慣指令、想接自己程式的人 | 提供本機 API(localhost:11434),社群已有上架版本 |
| llama.cpp | ★★★ | 想細調參數的進階玩家 | 彈性最高,需自行處理範本與 mmproj 設定 |
| vLLM | ★★★ | 要開服務給多人用 | 吞吐量佳,適合伺服器環境 |
安裝步驟阿正老師之前寫過完整教學,直接照著做就行:LM Studio 完整安裝教學(圖形介面、最推薦新手)與 Ollama 完整安裝教學(Windows + Mac)。裝好之後,在模型搜尋欄輸入 Qwen3.8-27B 找對應的 GGUF 版本下載即可。
阿正老師的環境是 R7 5800X + RTX 5070 12GB 桌機,以及 M4 Mac Mini 16GB。12GB 顯卡要跑 27B 會相當吃緊,建議測試時可以觀察三件事:載入後剩餘的顯示記憶體、每秒輸出的 token 數,以及把上下文拉長之後速度掉多少。Mac 這邊則是統一記憶體吃緊,16GB 機型跑 27B 量化版會相當勉強,建議挑更小的模型或改用雲端。
五、注意事項與台灣可用性
台灣能用嗎? 可以。Hugging Face、ModelScope 的權重下載,以及 Qwen Chat 網頁版在台灣都能正常連線(實際情況仍可能因網路環境而異)。權重載到自己電腦跑就是純本地運算,不會把資料傳出去。
資料會被拿走嗎? 用本地執行不會,這正是本地 AI 最大的賣點;但如果你是用 Qwen Chat 網頁版或雲端 API,資料就會送到對方伺服器,公司機密、個資這類內容請自行斟酌。
內容審查:中國訓練的模型在部分政治敏感題目上會有明顯的迴避或制式回答,這是使用前要有的心理準備。日常寫作、翻譯、程式、整理資料則不太受影響。
六、阿正老師的總結
只是想找個好用又免費的 AI 聊天
→ 直接開 Qwen Chat 網頁版,不用下載、不用顯示卡,五秒開始用。
有 24GB 顯示卡,想要一顆全能的本地模型
→ Qwen3.8-27B。看得懂圖、上下文夠長、授權自由,本地 AI 的當紅選擇。
要做產品、需要商用授權
→ Apache 2.0 是這次最大亮點,微調、包進自家服務都不用談授權。
開源 AI 的重點,正在從「多大」變成「多實用」
兆級參數的模型很威,但真正能改變一般人日常的,是這種塞得進自己電腦、又聰明得夠用的尺寸。Qwen3.8-27B 把多模態、超長上下文和寬鬆授權一次給齊,對想在本地養一顆 AI 的人來說,是這個夏天最值得試的一顆。
你的顯示卡跑得動嗎?跑起來每秒幾個 token?歡迎在下面留言跟阿正老師分享!









