发布更先进的语音到语音模型及全新API能力
We’re releasing a more advanced speech-to-speech model and new API capabilities including MCP server support, image input, and SIP phone calling support.
此次更新旨在为开发者提供更强大、更灵活的语音交互解决方案,进一步拓展实时语音应用的边界。
核心更新亮点
- 更先进的语音到语音模型:显著提升语音合成的自然度、响应速度与多语言支持能力。
- MCP服务器支持:允许模型直接调用外部工具与数据源,实现更复杂的任务编排。
- 图像输入:支持在对话中结合视觉信息,实现多模态理解与响应。
- SIP电话呼叫支持:可直接接入传统电话网络,实现语音机器人与真实电话系统的无缝集成。
这些新能力将帮助开发者构建更智能的语音助手、实时翻译工具、电话客服系统以及多模态交互应用。