UltraText Bench:全面评测图像生成中的视觉文本渲染能力
发布UltraText Bench,使用中英文密集文字场景评测图像生成模型的文字准确性、清晰度和布局能力。
AI 深度解读
论文发布 UltraText Bench,用于评测图像生成模型在复杂场景中生成中英文密集视觉文本的能力,关注价值在于把短文字正确率扩展到多区域、长字符串和版面布局的综合测试。
- 基准包含 432 个提示词,覆盖 24 类现实场景、3 个难度等级,并在中英文之间均分。
- 每条人工审核的提示词包含 4 至 12 个文字区域,以及内容、位置和视觉属性的结构化参考。
- 评测分别报告文字保真度、清晰度、空间质量和场景质量,避免用单一分数概括全部能力。
- 论文在 24 种模型配置上的结果显示,不同模型或版本可能在清晰度与保真度之间存在取舍;例如文中报告 Z-Image-Turbo 清晰度提高 3.81 分、保真度降低 14.76 分,Qwen-Image-2512 的英文综合分随难度由 86.50 降至 42.86。
- 影响/看点:该基准可能使图像模型的文字能力比较更接近海报、菜单和信息图等实际任务;但自动评分依赖 Q-Judger,且人工校验仅有 10 名参与者,结论仍受评分器和样本覆盖范围影响。
- 资料依据:
- UltraText Bench论文(2026-10-07):https://arxiv.org/abs/2610.09823
- UltraText Bench官方代码仓库(2026-10-08):https://github.com/LINs-lab/UltraText_Bench
本内容由 AI 生成,仅供参考,请注意甄别