GigaToken 號稱千倍,Windows 實測 43 倍,讀檔剩 16 倍
這週看到 GigaToken 的標題,我第一個反應是先找測試機規格。 「比 Hugging Face Tokenizers 快約 1000 倍」很難不點。但官方那筆 989 倍跑在雙路 AMD EPYC 9565,共 144 核心;另一筆 Apple M4 Max 甚至超過 1200 倍。這些數字是真的,直接搬到一般開發機上就很可疑。 我讓 Codex 在我的 Windows 筆電建一個乾淨環境,拿實際開發專案裡的公開套件程式碼重跑。最後沒有 1000 倍。資料先讀進記憶體時,套件 CLI 回報的三次倍率落在 39.86~49.77 倍,中位數 43.55 倍;把磁碟讀取也算進去,中位數剩 15.57 倍。 少掉一個零之後,速度仍然很兇。 我的測試環境這次用的是一台已經不新的開發筆電: Windows 11 AMD Ryzen 7 4800H,8 核心、16 執行緒 16 GB 記憶體 Python 3.12.2 gigatoken 0.10.0 tokenizers 0.23.1 GPT-2 tokenizer 語料來自 Hexo 專案 node_modules 裡的 JS...




