作者用「标签化匹配」把正则的性能优势带进命名实体识别:给模式绑定类别标签,命中时直接读出类别,开销仅是状态机执行时多一次数组查表,因此几乎是免费的。他与 spaCy 的小模型做了不严谨对比,10 个模式在 8 线程下达到 1.92 GB/s,比对方的 0.43 MB/s 快约 4500 倍。文章还演示用补集与交集在纯正则里写出日期规则,甚至把整个公历编码成一条 24504 字符的模式,编译后只有 32 个 DFA 状态。