2026年10月2日,苹果机器学习研究团队发布成果:在多语言语音模型预训练中强化语言判别能力,可缩小多语言模型与单语言模型的性能差距。

该研究基于英语/法语HuBERT对照实验,在总预训练数据预算匹配条件下,语言判别增强使连续音素等指标提升,部分指标追平单语言模型,同时保留跨语言信息共享。团队表示,辅助语言判别是缩小多语言差距的有效手段。

苹果以相同数据预算实现性能追平,意味着多语言大语言模型无需成倍增加预训练数据即可接近单语言水平,降低AI大模型的多语言部署成本。

来源:Apple Machine Learning Research