# 分词实验

2026-10-10；只运行已有 Whisper 文本分词器，不载入权重、不调用模型。
这是语音模型所用的文本分词器，演示实际切分；不能用于推算其他 LLM 的 Token 或价格。

从 V2.0 运行 `video/subtitle_service/.venv/Scripts/python.exe 示例/分词/实验.py`。依赖 `tokenizers`；配置已复制到本目录。

| 输入 | 字符数 | Token数 | ID序列 |
|---|---|---|---|
| `材质检查` | 4 | 7 | [4422, 238, 18464, 101, 16407, 222, 42623] |
| `material check` | 14 | 3 | [76, 40364, 1520] |
| `name.startswith(prefix)` | 23 | 10 | [16344, 13, 372, 11814, 11820, 7, 3712, 69, 970, 8] |

配置和完整结果见 [结果.json](<结果.json>)，包括配置 SHA256 和回解码一致性。
