其一为实时说话人分离,多人对话场景下可自动区分发言主体,标注每段语句归属,音色复刻稳定性显著提升;其二是原文译文同帧同出,双语内容同步展示,方便会议、直播等场景双语对照观看;第三是长上下文消歧,模型能够结合前…...