从"能听懂"到"能聊下去":Microsoft Foundry 上线实时语音与图像新模型(听到听懂听会 层次) ypxx.net

日前,微软在 Tech Community 的 Azure AI Foundry 博客发文,宣布 OpenAI 的 GPT-Live-1 与 GPT-Image-2.5 已在 Microsoft Foundry 上线。语音与图像两条能力线同时更新,指向的是同一件事:把对话变成应用的界面。

一、语音:不再轮流说话

GPT-Live-1 是实时、全双工语音模型,可以同时听和说。微软列出的能力包括音频输入输出并行、自然打断处理、停顿与节奏识别、backchannel 应答、上下文记忆,以及语音文本图像混合输入。官方的表述是,模型会持续评估该听、该说、该暂停、该回应打断,还是该调用工具,而不是把对话切成一串孤立的请求。

微软在文中提到一家房产信息平台的案例:该平台通过 Foundry 使用 Azure OpenAI 的实时模型,构建了覆盖超过 1 亿月活用户的住房搜索语音体验。

二、图像:改图可以接着改

GPT-Image-2.5 分两个版本。Flare 是较小的高吞吐版本,面向内容创作、营销素材、产品体验、视觉搜索与大规模出图,微软称其质量优于 GPT-Image-2,延迟降低 50%。Sunburst 面向需要精度与控制的创意工作流,例如广告级素材与产品图。

更关键的是编辑能力:只改指定元素而保留其余画面,多轮修改后保持一致性与画质,对复杂布局与风格指令的遵循更好。官方示例是一张晨光林间跑道的跑鞋图,连续三轮"调光线、调颜色、调构图"之后,前序细节仍被保留。这意味着素材可以在上一版基础上迭代,而不是每次重做。

三、价格与落地前的三个检查项

按微软给出的表格:图像模态输入 8 美元/百万 token,缓存输入 2 美元,输出 30 美元;文本模态输入 5 美元,缓存输入 1.25 美元;GPT-Live-1 音频 3 美元/小时。微软说明完整定价将在数周内上线 Foundry 定价页。

落地前建议核三件事。第一,延迟与质量的提升均为微软官方博客表述,缺少第三方复现,建议用自有素材盲测后再对外定口径。第二,音频按小时计费,实时语音成本由并发数和平均通话时长决定,估算逻辑与 token 计费不同。第三,实时语音涉及音频采集、留存与跨境传输,需在企业合规框架内确认数据路径;图像生成建议开启内容凭据与水印,便于后续溯源与审核。

领驭科技作为微软云代理商,可提供 Microsoft Foundry 与 Azure OpenAI 的账号开通、模型选型与配额规划、资源调配、合规接入咨询及持续运维。

注:微软所述服务为 Azure 国际版企业级服务,国内可用性需另按合规路径确认;文中定价与能力描述来自微软 Tech Community 官方博客(日前发布),以微软官方定价页与产品文档为准。