今天凌晨,OpenAI在美国旧金山召开了第二届开发者大会,发布了4大新的API功能。
实时语音API:每个APP里都可以拥有“Her”;
视觉微调API:只需100张图提升GPT-4o特定任务图像理解能力;
自动提示词缓存:模型最近见过的输入tokens统统打5折;
- 模型蒸馏API:用前沿模型的输出微调GPT-4o mini。
OpenAI发布的链接
Sam Altman表示,通过这些全新的API功能不仅能开发出强大且多元化的生成式AI功能、应用,同时将GPT-4、GPT-4o mini等模型的成本降低98%,同时处理token的数量暴涨50倍。下面是整理的4大API功能,对开发过程中有哪些重要帮助。
实时对话API
OpenAI在开发者大会上已经正式发布了实时API的公开测试版,允许所有付费开发者在他们的应用程序中构建低延迟、多模态的生成式AI功能。实时API提供类似最近新开放的ChatGPT的高级语音模式,支持使用API中已经支持的6种预设声音进行自然的语音到语音对话。这也就是说,可以将ChatGPT的多模态语音功能集成在应用中了。例如,可以开发一个外语口语训练应用,ChatGPT的语音模式可以帮助学员纠正他们的口语发音。OpenAI还引入了聊天完成API中的音频输入和输出,以支持不需要实时API低延迟优势的用例。开发者可以将任何文本或音频输入传递给GPT-4o,模型将以他们选择的文本、音频或两者的组合进行响应。此外,现在有了实时API,很快还有聊天完成API中的音频,开发者不再需要将多个模型拼接在一起来使用。你只需要使用一个API调用构建自然的对话体验。实时API使用文本和音频token价格:文本输入token的价格是每100万个5美元,输出token每100万个20美元。音频输入的价格是每100万个100美元,输出是每100万个200美元。这相当于每分钟音频输入约0.06美元,每分钟音频输出约0.24美元,整体价格相当划算。
自从 OpenAI 在 GPT-4o 上首次引入微调功能以来,已经有成千上万的开发者使用仅限文本的数据集定制模型,以提高特定任务的性能。然而,在许多情况下,仅对文本进行模型微调并不能提供预期的性能提升。因此,此次 OpenAI 宣布为 GPT-4o 引入视觉微调功能,允许开发者使用图像和文本来自定义模型的视觉理解能力,从而实现增强的视觉搜索功能、改进自动驾驶汽车或智能城市的物体检测,以及更准确的医学图像分析等应用。例如,东南亚的一家食品配送和共享出行公司 Grab 已经利用这项技术来改进其地图服务。仅使用 100 个示例的视觉微调,Grab 在车道计数准确率上提高了 20%,在限速标志定位上提升了 13%,超过了基础 GPT-4o 模型。这一现实世界的应用展示了视觉微调的可能性,即使用少量的视觉训练数据,也能显著增强各行各业的人工智能服务。目前,所有付费用户都可以使用视觉微调功能,直到 2024 年 10 月 31 日,OpenAI 每天为开发者提供免费的 100 万个训练 token,用于通过图像微调 GPT-4o 模型。2024 年 10 月 31 日之后,微调 GPT-4o 模型的费用将是每 100 万个 token 25 美元,推理的费用是每 100 万个输入 token 3.75 美元,每 100 万个输出 token 15 美元。
“提示词缓存”功能,旨在降低开发人员的成本和延迟。该系统自动对模型最近处理的输入标记应用 50% 的折扣,这可能会为经常重复使用上下文的应用程序带来大量节省。OpenAI平台产品负责人Olivier Godement表示:“我们一直高负荷运转。就在两年前,GPT-3 还大获成功。现在,我们已将成本降低了近 1000 倍。我试图举出一个在两年内将成本降低近 1000 倍的技术例子——但我找不到。”成本的大幅降低为初创企业和大型企业探索新的应用提供了重大机遇,而这些应用以前由于费用原因无法实现。2024 OpenAI DevDay 上的定价表显示,AI 模型的使用成本大幅降低,与各种 GPT 模型中的非缓存令牌相比,缓存输入令牌可节省高达 50% 的成本。新的 o1 模型更是反映了其先进的功能。这也牵扯到结构化提示词,只有提示中的前缀完全匹配时,才有可能实现缓存命中。要实现缓存优势,需要将静态内容(如说明和示例)放在提示的开头,并将可变内容(如用户特定信息)放在结尾。这也适用于图像和工具,它们在请求之间必须相同。
让开发者可以用o1-preive和GPT-4o等前沿模型的输出,对GPT-4o mini等小模型微调。此前,模型蒸馏是一个多步骤、易出错的过程,需要开发人员在互不关联的工具中手动协调多个操作,从生成数据集到微调模型和评估性能。由于蒸馏本质上是迭代的,需要反复运行每个步骤,大大增加了工作量和复杂性。这次OpenAI推出了新的集成工作流程,可自动获得前沿模型生成的输入-输出对、运行自定义评估、以及完成微调。同样在10月31日之前,在GPT-4o mini上每天提供200万个免费培训token,在GPT-4o上每天提供100万个免费训练token。AI实时语音应用已经露出曙光,结合视觉的更加现实可靠的产品,也已经在路上。可能很多人依然会把OpenAI的这次发布看作是“挤牙膏”,但不可否认,随着成本的降低和工程化落地的改善,新的应用、新的创新、新的更全能的开发者,也许会细水长流般绵绵不绝……
参考链接:
[1]https://x.com/swyx/status/1841262588447146133
[2]https://x.com/GregKamradt/status/1841266096277696742
[3]https://x.com/dpkingma/status/1841134573595312344
[4] https://x.com/NickADobos/status/1841167978085433351
[5]https://x.com/dicnunz/status/1841176999773262031
[6]https://fortune.com/2024/10/01/openai-sam-altman-mira-murati-gpt-4o-o1-chatgpt-turbulent-year/