Mojibake:用 C 语言编写的底层 Unicode 处理库
来源:mojibake.zaerl.com — 2026-07-17
📋 概述
Mojibake 是一个用纯 C 语言编写的底层 Unicode 库,专注于正确性和最小化。作者将 Unicode 标准的复杂性封装在一个简洁的 API 中,同时提供完整的 UTF-8/16/32 转换、规范化、大小写映射和字形分割功能,适合嵌入式和性能敏感场景。
🔑 核心要点
- 纯 C99 实现,零外部依赖,可编译为约 150KB 的静态库
- 完整支持 Unicode 15.1 的所有规范化形式(NFC、NFD、NFKC、NFKD)
- 提供 字形簇(Grapheme Cluster)分割,正确处理表情符号和组合字符
- 所有 API 设计遵循 "要么正确,要么报错" 原则,不静默生成乱码
- 项目名称 "Mojibake" 是日语 "文字化け"(乱码),自嘲式的命名恰好表达了项目使命的反面
💡 金句
Unicode is hard. Most libraries get it 95% right. Mojibake aims for 100%, because the 5% gap is where user-visible bugs are born — a character that renders as a box, a string that sorts wrong, an emoji that breaks your layout.
← 返回 Hacker News 首页