Braşov 还是 Brașov?15 个大模型写对我的城市名,直到你先写错

📌 One-Sentence Summary
一项基于 Kaggle 的基准测试通过代码点评分法对 15 个大模型进行评估,结果显示它们能正确书写罗马尼亚语 ș/ț,但会如实复制输入中的遗留 cedilla 字符 ș/ţ,而单一的系统提示规则可将准确率从 64% 提升至 96%。
📝 Summary
罗马尼亚语使用带下方逗号的 ș 和 ț(U+0219/U+021B),但 20 世纪 90 年代的编码被迫使用了形似 cedilla 的字符(U+015F/U+0163),这一字符至今仍充斥着罗马尼亚网络:2026 年 9 月 30 日检查的 35 个网站首页中,30 个包含 cedilla 字母。作者在 Kaggle 上构建了一个包含六项任务(写作、回声、修正、查看、还原、编码)的基准测试,涵盖 15 个模型,并通过 Unicode 代码点对每个答案进行评分,未使用 LLM 评判。写作任务几乎已被解决(15 个模型中有 11 个完全正确),但当相同文本以 cedilla 输入时,无错误答案下降至 44%~85%,且 93% 的错误单词被原样复制自输入。更强大的模型复制得更加忠实,甚至会在源文本中不存在的单词中生成 cedilla 字母。说出「校对」只能修复 79% 的字母,而指明附加符号可以达到 99%。添加一条系统提示规则将无错误答案率从 64% 提升至 96%。结论是:在模型前后对文本进行规范化处理,而不是指望它来修复编码问题。
💡 Main Points
大模型已经知道正确的罗马尼亚字母;失败在于继承,而非知识缺乏。
使用 ASCII 名称的英文提示词时,15 个模型中有 11 个正确书写了每个罗马尼亚单词,其中 8 个在全部 30 个语境句中恢复了附加符号。错误仅在输入本身包含遗留 cedilla 字符时出现。
Cedilla 输入会污染输出,且模型越强大复制得越忠实。
在干净输入上,每个模型在 45 次运行中均得 100%;对同一文本使用 cedilla 输入后,无错误答案降至 44%~85%。Claude Opus 5(56%)和 GPT-6 Astra(55%)低于 GPT-5.4 nano(61%)和 Qwen 3(85%),93% 的错误单词(1,186 个中有 1,105 个)被原样复制自输入。
被问什么比用哪个模型更重要。
使用 cedilla 输入时,回复消息产生 97% 无错误答案,概括为 62%,检索风格回答仅 45%。回复意味着写出新句子;概括和回答复用了文档的字节。
模糊指令表现不如明确指令,且过度规范会缩小修复范围。
「校对」修复了 79% 的字母,而「修正拼写和附加符号」达到 99%。在代码中,列出四个错误字母的方式仅 1 个程序(15 个中)正确处理了分解字母(s + U+0327),而仅基于目标的提示词则有 6 个。
单一系统提示规则加上流程规范化是实际解决方案。
添加一条关于正确罗马尼亚正字法的句子后,所有模型的无错误答案率从 64% 提升至 96%,其中 10 个模型完全正确。作者仍然建议在模型前后进行 NFC 规范化处理,并配合 cedilla 到逗号的转换表。
💬 Key Quotes
越强大的模型,越一致地将文本编码视为一种要匹配的风格,就像它会匹配你的语气或正式程度一样。
失败是**继承**: whatever 编码在上下文中出现,就原样返回,模型越好,返回得越忠实。
模型知道规则,只是不加以应用,除非你要求,因为匹配你的文本正是它们被构建的用途。
如果我只测试了有差异的字符对,我会得出相反的结论。每个「找不同」基准测试都需要包含无差异的字符对。
一个关于错误单个字符的基准测试,被输入中的一个错误字符破坏。
📊 Article Meta
AI Screening: 88
Source: DEV Community: machinelearning
Author: Butnar Daniel
Category: 人工智能
Language: 英文
Read Time: 10 min
Word Count: 2355
Tags:
AI 评估与基准测试 , 大语言模型 , Kaggle , 机器翻译 , 提示工程
点赞,必须点赞
这篇文章分析得很透彻,收藏了!
这个比较实用,已转发给同事。
这个比较实用,已转发给同事。
实测过类似工具,作者说的基本属实。
看标题就点进来了,内容果然没让人失望。
很有价值的分享,感谢整理。
很有价值的分享,感谢整理。
路过
很有价值的分享,感谢整理。
看完了,收获满满,期待更多更新。
内容翔实,正好需要,先收藏再看。