分词实验
2026-10-10;只运行已有 Whisper 文本分词器,不载入权重、不调用模型。 这是语音模型所用的文本分词器,演示实际切分;不能用于推算其他 LLM 的 Token 或价格。
从 V2.0 运行 video/subtitle_service/.venv/Scripts/python.exe 示例/分词/实验.py。依赖 tokenizers;配置已复制到本目录。
| 输入 | 字符数 | Token数 | ID序列 |
|---|---|---|---|
材质检查 |
4 | 7 | [4422, 238, 18464, 101, 16407, 222, 42623] |
material check |
14 | 3 | [76, 40364, 1520] |
name.startswith(prefix) |
23 | 10 | [16344, 13, 372, 11814, 11820, 7, 3712, 69, 970, 8] |
配置和完整结果见 结果.json,包括配置 SHA256 和回解码一致性。