中文文本不像英文那样天然带有空格分隔符,词与词之间的边界是隐性的。分词的任务就是将连续的汉字序列切分为有意义的词语单元,它是文本理解、信息检索和机器翻译等上层应用的基础。分词质量直接影响后续任务的精度,因此根据业务需求选择合适的实现方案,比追求复杂的模型更为关键。
这是落地最快、原理最为直观的一类方案。其核心在于一份整理完善的词表,借助字符串匹配算法,将输入的文本与词库中的词条进行比对切分。根据扫描方向与匹配策略的区别,衍生出几种具体的实现方式。
正向最大匹配法从文本左侧开始,以词库中最长词条长度为窗口截取子串进行匹配。例如遇到“研究生命起源”,它会优先匹配更长的词,从而得出“研究/生命/起源”而非“研究生/命/起源”。逆向最大匹配法则从右侧开始扫描,在面对某些以单字词结尾的歧义段落时更具优势。更为稳妥的做法是双向匹配,即同时执行正逆两种扫描,通过比较分词后的词数或单字词数量,自动选取更优的结果。
需要留意的是,这类方法严重依赖词表的完整度与时效性。如果是处理用户评论或行业新词频繁出现的领域文本,需要建立定期更新词库的机制,否则专有名词很容易被错误切分,直接影响准召率。
统计方法不再依赖词典的绝对齐全,而是尝试从大规模语料中学习字与字之间共同出现的概率与条件分布。隐马尔可夫模型(HMM)与条件随机场(CRF)是两条极具代表性的路径。
HMM 将分词任务转化为对每个字符进行位置标注的过程,常用标签集为 B(词首)、M(词中)、E(词尾)与 S(单字词),并通过维特比算法推算出概率最佳的标签序列。CRF 则放宽了 HMM 对观测状态独立性的限制,可以灵活引入上下文中的多维特征,在识别复杂词边界时展现出更高的精度,这也是它在传统统计方法中长期保持优势的原因。
这类模型一个突出的优点是具备一定的未登录词发现能力。如果“端侧推理”在训练语料中经常高频率相邻出现,模型有机会在参数学习中将其聚合为一个整体。不过代价同样明显:需要准备规模够大且与目标领域分布一致的标注语料开展训练,中间调试周期与离线推理的耗时都明显高于词典法。
随着算力成本下降,深度学习架构逐渐成为主流选择,代表包括双向长短时记忆网络(BiLSTM)和以 Transformer 为基础的预训练语言模型。
BiLSTM 通过双向隐层状态把前后文的信息融合进每个字符的向量,处理长距离依赖的能力优于 CRF。以 BERT 为代表的预训练模型则更进一步,其在大规模无监督文本上执行掩码预测任务,内部积累了丰富的通用语义知识。用于分词时,只需在顶层接入一个轻量级分类层做微调,就能在公开评测上取得领先成绩。
一个常被提及的例子是短语“南京市长江大桥”。深度学习模型能够利用上下文理解“南京市”与“长江大桥”之间的语义修饰关系,切出正确结果,而不是误判成“南京/市长/江大桥”。这种对歧义的消解能力,正是传统词典与统计方法在语义判别层面的明显短板。
不过也应当看到,深度模型带来的代价是较大的参数规模导致的 GPU 显存占用,以及推理延迟往往难以压进毫秒级,对于高并发的在线服务而言需要谨慎评估硬件成本与响应性能。
工程实践中,极少需要从零构建分词器,通常是在现成的开源方案间做取舍。哈工大 LTP 在传统结构化任务上有扎实积累,适合学术与通用场景;jieba 以轻量、易于部署著称,适合快速原型和中小规模文本处理;而基于 BERT 的语义分词服务,则更适合对准确率要求极高且能承担算力开销的核心业务。
选型时可以参照以下判断标准:文本量级在小规模且对速度敏感,优先考虑词典方案;语料具有鲜明的领域性且希望控制成本,可尝试 CRF 并定制词表;若追求极致效果且算力充足,再引入预训练模型微调。
对于词典法,最直接的方式是定期将搜集到的新词人工审核后录入词库。对于统计模型,可以持续补充该领域的无标注语料进行增量训练,增强模型对字间共现频率的感知能力。若场景变化极快,也可以在分词后追加一层基于规则的修正,对特定模式强制执行正确切分。
有差异。短文本如搜索词往往上下文信息稀少,各类模型的准确率都会下降,此时词典提供的先验信息反而更可靠。长文本上下文充足,深度学习模型的自注意力机制能更充分捕捉语义关联,准确率相对更稳定。因此在短文本场景中,建议保留词表兜底,避免完全依赖数据驱动。
首先确认输入文本的领域是否与模型训练语料一致,如果差异过大,优先采集同分布数据补齐。其次检查词表与分词器的参数策略,比如最大匹配窗口长度是否合适。若问题集中在少数特定词汇上,通常比调整整个模型更经济的做法是增加自定义词典,这能快速缓解大部分可见错误。
在实际项目中选择分词方案,应遵循“需求决定选型”的原则。对延迟敏感、数据量可控的应用,基于词典的机械法依然高效可靠;数据规模较大且对未登录词有要求时,统计模型会在精度与成本间取得较好平衡;而对准确率有极致要求的语义密集场景,投入算力运行深度预训练模型是当前更合理的选择。建议从业务数据的实际效果出发做横向对比,并保留一套持续的评测集用于跟踪分词质量变化。