OpenAI 在 2023 年 11 月的首届开发者大会上,发布了多项重磅更新,旨在为开发者提供更强大、更灵活、更经济的 AI 工具。本次发布的核心亮点包括:GPT-4 Turbo 模型(支持 128K 上下文窗口且价格更低)、全新的 Assistants API、集成视觉能力的 GPT-4 Turbo with Vision,以及 DALL·E 3 API 等。
GPT-4 Turbo:更强大、更便宜、更长上下文
GPT-4 Turbo 是本次发布的重中之重。它支持高达 128K 的上下文窗口,这意味着模型可以一次性处理相当于 300 多页文本的内容,极大地扩展了应用场景。在价格方面,GPT-4 Turbo 的输入 token 价格降低了 3 倍,输出 token 价格降低了 2 倍,使得大规模应用 AI 的成本显著下降。
此外,GPT-4 Turbo 的知识截止日期更新至 2023 年 4 月,并引入了更精确的指令跟随能力和 JSON 模式,方便开发者构建稳定的结构化输出应用。
Assistants API:构建智能代理的新范式
全新的 Assistants API 旨在帮助开发者构建具备自主能力的 AI 助手。该 API 内置了多项关键功能,简化了复杂代理应用的开发流程:
- 代码解释器:允许助手在沙盒环境中编写并运行 Python 代码,处理数学问题、数据分析和可视化等任务。
- 检索功能:支持从外部知识库(如文档、数据库)中检索信息,增强回答的准确性和时效性。
- 函数调用:助手可以调用开发者定义的函数,与外部系统(如 API、数据库)进行交互,执行具体操作。
Assistants API 通过持久化的线程(Threads)管理对话状态,使得多轮交互更加自然和高效。
多模态能力扩展:视觉与图像生成
本次更新进一步强化了多模态能力。GPT-4 Turbo with Vision 允许模型理解图像输入,可用于图像描述、视觉问答、文档解析等场景。同时,DALL·E 3 API 正式开放,开发者可以轻松地将高质量的文本到图像生成功能集成到自己的应用中,支持多种尺寸和格式的输出。
其他重要更新
除了上述核心功能,OpenAI 还发布了以下更新:
- 文本转语音 API(TTS):提供六种自然语音,支持实时流式输出,可用于语音助手、有声内容生成等。
- Whisper v3 语音识别模型:提升了语音转文字的准确率和鲁棒性,并已开放 API。
- JSON 模式与函数调用改进:确保模型输出合法的 JSON 对象,并支持并行函数调用,提升复杂任务的处理效率。
- 版权保护计划(Copyright Shield):OpenAI 将为其 API 用户提供版权侵权索赔的法律辩护,减轻用户的法律风险。
OpenAI CEO Sam Altman 表示:“我们致力于让 AI 更安全、更易用、更普及。今天的发布是我们在这一方向上迈出的重要一步,我们期待看到开发者利用这些工具创造出更多令人惊叹的应用。”
所有新模型和 API 均已向开发者开放,开发者可以通过 OpenAI 官方平台立即开始使用。此次更新标志着 AI 应用开发进入了一个新的阶段,为构建复杂、智能、多模态的下一代应用提供了坚实的基础。