阿里千问发布Qwen3.8‑LiveTranslate,一款面向会议、跨语言通话和直播字幕的实时音视频同声传译模型。它把音频、视频画面、原文和译文交织进同一条时序序列,在说话尚未结束时持续生成译文;官方称其长度自适应平均滞后由上一代的2.8秒降至2.3秒,降幅约18%。模型能接收60种语言并输出相应文本,其中29种语言可以进一步合成语音;新增能力包括多人说话者区分、分别保留说话人音色、原文与译文同步显示,以及利用历史对话和画面消除人名、术语与同音词歧义。不过,2.3秒是LAAL评测指标,并非从声音进入麦克风到用户听见译文的完整端到端延迟。官方也没有公开参数量、模型权重、训练数据、完整逐语言成绩或独立复现结果,目前主要通过云端API提供。
文章作者、来源:Qwen
它要解决的不只是“把语音翻译成另一种语言”
传统实时翻译系统通常可以拆成三个阶段:先把语音识别成文字,再进行机器翻译,最后把译文转换成语音。这种流水线容易部署,但每个阶段都会增加等待时间和错误:识别阶段听错一个名字,翻译阶段可能将错误继续放大;如果存在多人交替发言,系统还可能分不清哪句话属于谁,最终合成语音也会失去原说话人的声音特征。
Qwen3.8‑LiveTranslate尝试把这些任务放进一个连续的流式系统中。它采用基于混合专家模型的Thinker–Talker双模块设计。
Thinker负责把视频画面、正在到达的音频、源语言文字和已经产生的译文,按照时间顺序交织进同一条因果序列。模型不必在每个时间片重新读取完整对话,而是可以复用已经听过的音频及已经输出的翻译缓存。
Talker则根据译文和源音频生成目标语言语音,并尽量保留原说话人的音色。换句话说,系统试图传递的不只是“说了什么”,还包括“是谁说的”。
2.3秒不是网络请求延迟
此次发布最醒目的数字,是LAAL由2.8秒降低到2.3秒。
LAAL全称为Length-Adaptive Average Lagging,即长度自适应平均滞后。它测量模型生成译文时,平均落后于源语言内容多少时间,并对译文过长造成的评测偏差进行修正。它比只记录第一个译文Token何时出现,更能反映整段同传是否始终跟得上讲话者。
因此,2.3秒并不是普通用户从开口到听见第一段声音所经历的固定延迟,也不包括所有客户端录音、网络传输、服务器排队和音频播放缓冲。实际体验还会受到网络位置、输入音频质量、目标语言、是否生成语音以及说话速度影响。
这一数字仍有意义:按官方口径,平均滞后缩短了约0.5秒,降幅约18%。对于需要持续听译文的会议和直播,稳定少落后半秒通常比偶尔极快地输出第一个词更重要。
多人会议是这一代的重点
Qwen3.8‑LiveTranslate新增了实时说话人分离能力。多人轮流发言时,系统会判断不同语句属于哪位说话人,并在输出文本中保留对应身份;生成目标语言语音时,也会尝试分别复刻各人的音色。
这项能力适用于访谈、圆桌讨论和跨国会议。传统同传系统即使翻译正确,也可能把所有发言合成为同一个声音,使听众难以判断对话关系。Qwen希望让译后音频仍然保留“谁在回应谁”的结构。
但官方只明确展示了多人交替发言,没有公布多人同时说话、强背景噪声、远距离收音或高度相似声线下的详细错误率。所谓“保留音色”也不等于完整复刻情绪、语气和说话节奏。
在API示例中,开发者可以在同一个WebSocket会话中开启源语言识别、说话人标识、译文文本和合成语音,不必为每个结果单独发起请求。输入示例采用16kHz单声道PCM,合成语音为24kHz PCM。
画面和历史对话也会参与翻译
纯语音翻译经常遇到仅靠发音无法解决的歧义。例如,一个人说出同音的人名或地名时,字幕、演示文稿、商品包装或画面中的文字,可能才是决定正确译法的关键证据。
Qwen3.8‑LiveTranslate允许客户端在音频流之外发送图像帧,把视觉信息作为翻译上下文。官方演示使用《西游记》对话和同音词示例,展示画面怎样帮助判断词义。
模型还会利用较长的历史对话保持术语一致。如果某个姓名、项目或产品在前文已经出现,后面的指代和简称可以参考之前的翻译,而不是每句话都重新猜测。
这使它更适合持续会议,而不只是翻译一句独立语音。不过,官方尚未说明上下文能够稳定覆盖多长时间,也没有展示跨会议长期记忆;相反,跨会话记忆被列为未来方向。
“支持60种语言”需要拆开理解
模型能够接收60种语言的音频,并输出译文文本。覆盖范围除了中文、英语、日语、韩语、法语和西班牙语等常见语言,还包括粤语、孟加拉语、斯瓦希里语、哈萨克语、吉尔吉斯语和马拉雅拉姆语等。
但语音输出只覆盖其中29种语言。因此,“支持60种语言”不代表所有语言组合都能获得保留音色的语音同传;部分语言只能输出文本。
官方在公开FLEURS音频测试集上评测了70个翻译方向,考察翻译质量、LAAL、语音识别准确率和语音合成质量,并称新模型领先上一代及若干主流实时同传系统。
另一项Omnilingua‑MSpeaker测试覆盖14个多人长音频翻译方向,指标包括忠实度、流畅度、简洁度和说话人分离错误率。官方同样报告新模型整体领先。
这些结果目前仍属于厂商自测。官方没有同时公开完整逐语言数值、置信区间、人工评审细节和原始输出,外界也尚未完成独立复现。因此,不能仅根据汇总图认定模型在每种口音、领域和语言组合上都领先。
目前是云端服务,不是可以下载的开放模型
尽管Qwen系列经常发布开放权重模型,Qwen3.8‑LiveTranslate此次没有公布可下载权重,也没有披露总参数量、激活参数量、训练算力或训练数据组成。目前可通过QwenCloud和DashScope的实时WebSocket接口使用。
国际版模型页面列出的价格为:音频输入每百万Token 7.5美元,图像输入0.55美元,文本输出20美元,语音输出30美元;上下文总量为53K Token,其中输入上限49K、输出上限4K。
音频Token与实际分钟数的换算率没有在模型页面给出,所以不能仅凭这些价格准确算出“一小时会议需要多少钱”。语音输入和语音输出还会同时计费,视频场景也可能产生图像Token。
云端部署也意味着会议语音、图像和可能用于克隆音色的数据需要发送到服务端。此次技术博客没有详细讨论数据留存、音色克隆授权、水印及企业私有化部署方式,这些将是医疗、法律和企业会议采用时需要另外核实的问题。
真正的进步,是从“翻译句子”走向“翻译一场交流”
Qwen3.8‑LiveTranslate最值得关注的地方,并不是单纯再增加几十种语言,而是把实时翻译的目标从句子准确率扩展到整个交流过程:维持较低滞后、识别不同发言人、保留声音身份、同步展示原文,并利用画面和历史语境维持术语一致。
它还没有证明能够替代专业同传。专业译员会处理隐喻、文化背景、发言策略和未明确表达的意图;当前模型也没有公开覆盖突发抢话、严重噪声、强口音及高风险外交或医疗场景的完整评测。
但技术路线已经相当明确:下一代翻译产品不再只是“语音识别加机器翻译”,而会逐渐成为一个持续感知人物、声音、画面和上下文的多模态交流层。