总判断:先分字形、字符和词义
看到三个“女”时,先问三个问题:它占一个字格还是三个字格?能否一次选中?上下文使用简体还是繁体?若占一格并呈组合结构,通常是“姦”,读jiān;若连续占三格,那只是“女女女”。
这套判断比单纯“看着像”可靠,因为汉字处理有三层:字形负责显示,字符负责编码,词义由上下文决定。三层混在一起,错误就会沿着复制、搜索、排版一路传下去。
女女女避坑要先抓住一个底层事实:视觉上像“三个女”,不等于电脑里就是同一个字。单字“姦”、字符串“女女女”、现代简体字“奸”,在编码、排版和使用场景上都有区别。最常见的问题不是不会读,而是识别正确后又被错误替换、转码或选字体。
看到三个“女”时,先问三个问题:它占一个字格还是三个字格?能否一次选中?上下文使用简体还是繁体?若占一格并呈组合结构,通常是“姦”,读jiān;若连续占三格,那只是“女女女”。
这套判断比单纯“看着像”可靠,因为汉字处理有三层:字形负责显示,字符负责编码,词义由上下文决定。三层混在一起,错误就会沿着复制、搜索、排版一路传下去。
OCR依靠图像特征匹配。旧报纸墨迹断裂时,一个合体字可能被切成多个识别框;字距紧密时,三个独立字也可能被合并。它给出的只是概率最高结果,不是校勘结论。
避坑办法是保留原图坐标,逐字对照,并用上下文复核。若原文处在固定词语中,还要查同版其他位置的字形。批量替换前先抽查20处,比修复整页误替换省时得多。
现代大陆简体文本里,“姦”的相关意义通常归入“奸”,但这不代表任何历史文本都能直接把两字互换。繁体地区的字书和排印传统可能保留词义、词形上的分工,原文引用尤其不能擅改。
转换时应区分内容类型:普通简体改写可按现行规范;学术引文保留原字;面向不同地区重排,则采用当地字形规范并留下版本说明。真正危险的是不看语境的一键转换。
U+59E6明确了“姦”的字符身份,却不保证每台设备都显示一致。字体缺字时,页面会出现方框、空白或临时回退字体;这属于显示问题,不代表字符已经丢失。
解决顺序应是先检查编码,再换覆盖完整的中文字体,最后测试网页、PDF和移动端。女女女避坑的结论很明确:确认单字结构,核对辞书与码位,按文本场景决定保留还是转换,任何一步都别靠肉眼猜完。
通常是当前字体不包含该字形。字符可能仍然存在,可换用覆盖较全的中文字体,并检查文本编码是否为UTF-8。
不能全局替换。原文可能真的连续写了三个“女”。必须先确认它们在图像中属于一个字格,并结合上下文逐处检查。
现代规范简体正文一般写“奸”。但古籍引用、字形讨论或忠实转录原文时,可以保留“姦”并说明版本。