配套资料

分词实验

2026-10-10;只运行已有 Whisper 文本分词器,不载入权重、不调用模型。 这是语音模型所用的文本分词器,演示实际切分;不能用于推算其他 LLM 的 Token 或价格。

从 V2.0 运行 video/subtitle_service/.venv/Scripts/python.exe 示例/分词/实验.py。依赖 tokenizers;配置已复制到本目录。

输入 字符数 Token数 ID序列
材质检查 4 7 [4422, 238, 18464, 101, 16407, 222, 42623]
material check 14 3 [76, 40364, 1520]
name.startswith(prefix) 23 10 [16344, 13, 372, 11814, 11820, 7, 3712, 69, 970, 8]

配置和完整结果见 结果.json,包括配置 SHA256 和回解码一致性。