苹果发布 DiscoSign:基于大模型的话语感知文本至手语翻译框架
苹果发布手语翻译框架DiscoSign,借助大模型解决篇章级空间指代与特殊从句翻译问题。
AI 深度解读
苹果机器学习研究团队联合多所高校推出话语感知文本至手语翻译框架 DiscoSign,将手语翻译的研究重点从单句推进至篇章级别。
- 传统手语翻译系统多局限于单句处理,容易丢失篇章上下文中的空间指代与语篇连贯性。
- DiscoSign 基于大语言模型构建模块化框架,重点解决空间共指消解、问答子句结构处理以及概念与手语词元的一致性映射。
- 提出了用于评估篇章连贯性各维度的专用评估指标套件,弥补了传统单句指标无法衡量篇章质量的不足。
- 实验结果表明,该模型在维持单句翻译质量的同时,有效改善了实体追踪和空间位置的一致性。
- 影响/看点在于该研究填补了长文本手语翻译在空间和语篇建模上的方法空白,若未来与高质量手语动作合成系统结合,可能改善听障人群辅助交互体验的流畅度与准确度。
- 资料依据:
- Apple Machine Learning Research(2026-09-11):https://machinelearning.apple.com/research/discosign-gloss-translation
- arXiv(2026-09-02):https://arxiv.org/abs/2609.02796
本内容由 AI 生成,仅供参考,请注意甄别