馬克雷達MARK RADAR
EN

史丹佛學者開源超高速斷詞庫 Gigatoken 效能提升數百倍

1 篇報導 · 首次偵測 2026-07-23 · 最後活動 2026-07-23

大型語言模型在訓練與推論前,必須先透過 BPE 等方法將文字切分為 token;面對龐大資料集時,斷詞速度可能成為文本編碼與預處理的瓶頸。高效且相容多種模型的工具,因此可望縮短資料準備時間並降低運算資源占用。

史丹佛大學博士生 Marcel Rød 近日開源以 Rust 打造的 BPE 斷詞庫 Gigatoken,處理速度最高達每秒 24.53 GB。公布的效能數據顯示,它最快比 HuggingFace Tokenizers 高出 989 倍,並已支援 GPT-2、Llama、DeepSeek 等 23 種主流大型語言模型。

全部報導

1 篇原始報導

馬克翻舊帳

這個事件的歷史脈絡

這個訊號沒有歷史回聲

馬克雷達|MARK RADAR
全站時間均為台北時間(GMT+8)