PrismML由加州理工學院研究團隊創立,執行長Babak Hassibi為該校教授,專攻模型壓縮。公司主張以低位元權重讓高效能推理模型從雲端下放至PC與高階手機,降低記憶體、延遲與能耗,並讓敏感資料留在裝置端;其種子輪已募得2,225萬美元。
PrismML於2026年9月17日發布Ternary Bonsai 2 27B,將阿里巴巴開源模型Qwen3.8 27B從FP16約54 GB壓縮至5.9 GB,縮小逾9倍。公司稱新模型在20項基準測試綜合得分83.9,保留原版85.4分的98.2%,並以Apache 2.0授權免費提供,支援26.2萬token脈絡與圖文輸入。
全部報導
2 篇原始報導馬克翻舊帳
這個事件的歷史脈絡使用 PrismML 部署 Bonsai-27B 大語言模型與本地推理
Bonsai-27B 是採用 1-bit 權重量化的約 270 億參數大語言模型,主打降低記憶體與運算需求。PrismML 透過修改版 llama.cpp 支援本地推理,讓開發者可運用 NVIDIA CUDA 硬體部署模型,減少資料送往雲端服務所涉及的成本、延遲與隱私風險。
最新部署指南示範編譯 PrismML 版 llama.cpp 的 CUDA 核心,並下載 Bonsai-27B 模型權重,再啟動與 OpenAI API 相容的本地推理伺服器。流程支援多輪對話及程式碼生成,應用程式可沿用既有 OpenAI 客戶端介面;報導未提供發布日期、效能基準或部署成本。
訂閱馬克雷達週報
每週五,本週最強訊號送進收件匣。隨時一鍵退訂。