GPT-6 Sol 和 GPT-6 Luna 已上线 Smart AIPI——75% 折扣,成本仅为 5.6 系列的一半
OpenAI 刚刚扩展了 GPT-6 系列,推出 GPT-6 Sol 和 GPT-6 Luna——采用 Astra 级智能并针对成本效率进行优化,价格仅为 GPT-5.6 Sol 和 Luna 的一半。两者现已在 Smart AIPI 上线:gpt-6-sol 每 1M tokens 的价格为 $0.50 / $0.05 / $2.50,gpt-6-luna 为 $0.025 / $0.0025 / $0.125——比 OpenAI 官方价格低 75%。以下是实际基准测试、价格计算,以及该选择哪一个模型。
简要总结: gpt-6-sol 和 gpt-6-luna 今天已在 Smart AIPI 上线。Sol 每 1M tokens 的价格为 $0.50 / $0.05 / $2.50;Luna 为 $0.025 / $0.0025 / $0.125——比 OpenAI 官方价格低 75%。它们将 GPT-6 Astra 的训练成果带入更快、更实惠的模型:Sol 在 AutomationBench 上击败 Claude Opus 5,单项任务成本约为其 ~9%;Luna 在 DeepSWE 上的成绩与前沿模型相差不到 1 分,同时成本降低 90%+。下文将介绍实际数据,以及应该运行哪一个模型。
本月早些时候,OpenAI 推出了 GPT-6 Astra,这是其智能程度和对齐能力最高的模型。要求最高的项目仍然需要 Astra 的完整能力——但工作发生在不同的规模、节奏和预算下。这正是 OpenAI 扩展 GPT-6 系列、推出 GPT-6 Sol 和 GPT-6 Luna 的原因;两者目前都已在 Smart AIPI 上线,价格仅为 OpenAI 官方价格的四分之一。
这些模型采用了与 Astra 类似的方法进行训练,将其在专业工作、事实性、编码、计算机使用和对齐方面的进步带入更快、更实惠的产品层级。GPT-6 系列在成本与智能的曲线上全面领先,而 OpenAI 通过将 Sol 和 Luna 的 API 价格相较 GPT-5.6 的促销价格降低 50%,将效率提升带来的收益传递给用户。Smart AIPI 在此基础上进一步提供 75% 的折扣。
对开发者真正重要的结果
Sol 和 Luna 针对成本与智能的前沿进行了调优,因此下面的每项分数都值得结合其成本来解读。
| 基准测试(尽力而为) | GPT-6 Sol | GPT-6 Luna | Claude Opus 5 |
|---|---|---|---|
| DeepSWE v1.1 | 68.8% | 66.6% | — |
| Agents' Last Exam | 56.4% | — | < 56.4% |
| AutomationBench | 33.2% | — | 26.9% |
| OSWorld 2.0(离线、计算机使用) | 60.5% | — | 60.3% |
分数只说明了一半——另一半在于达到这些分数需要付出多少成本。
专业工作
在 AutomationBench(涵盖销售、营销、运营、支持、财务和人力资源等 47 个工具的端到端业务工作流)上,GPT-6 Sol 在 xhigh 工作量下以 每项任务 $0.27 的成本达到 33.2%——以约为 Claude Opus 5 每项任务成本9%的价格,超过了其最大工作量下的成绩(26.9%),甚至超过低工作量的 GPT-6 Astra(30.3%)。在高工作量下,GPT-6 Luna 相比上一代提升了 5.4 个百分点,同时每项任务成本降低 58%。在 Agents' Last Exam 上,最大工作量下的 Sol 得分为 56.4%,高于 Claude Opus 5 在该评测中的最高分,同时每项任务成本降低 60%。
编码
在 DeepSWE v1.1(真实代码库中的原创、长周期软件工程任务)上,最大工作量下的 GPT-6 Sol 得分为 68.8%——与 Claude Fable 5 在该评测中的最佳成绩相差 1.1 分以内(xhigh 下为 69.9%),同时每项任务成本约降低 80%。最大工作量下的 GPT-6 Luna 得分为 66.6%,与中等工作量下的 Claude Opus 5 和 Fable 5 相当,但每项任务成本比 Opus 5 低 93%,比 Fable 5 低 96%。在 FrontierCode 上,该测试不仅评估正确性,还评估可合并性(测试质量、范围控制和代码风格);Sol 相比 GPT-5.6 Sol 有显著提升,并以更低成本达到 Claude Fable 5.1 xhigh 的水平。
计算机使用
Astra 仍然是全球最优秀的计算机使用模型,但 Sol 和 Luna 的成本效率远高于前代。在 OSWorld 2.0 offline 上,xhigh 下的 GPT-6 Sol 达到 60.5%——以约低 80% 的每项任务成本,达到中等工作量下 Claude Opus 5 的水平(60.3%)。最大工作量下的 GPT-6 Luna 超过了中等工作量下的 GPT-5.6 Sol,而成本仅为其十分之一。
事实性与对齐
在 OpenAI 的内部事实性评测中——该评测基于用户标记错误的去标识化真实对话——GPT-6 Sol 的错误数量约为 GPT-5.6 Sol 的一半,以低得多的成本接近 Astra 级别的可靠性。Luna 同样取得了显著提升。两者都继承了 Astra 引入的对齐成果,相比 GPT-5.6 同系模型均有改进,包括减少对自身编码工作做出误导性声明的情况。
定价:75% 折扣,相同模型,相同 API
Smart AIPI 收取 OpenAI 官方价格的 25%。以下是两款模型的具体计算。
| gpt-6-sol,每 1M tokens | OpenAI 直接价格 | Smart AIPI | 节省 |
|---|---|---|---|
| 输入 | $2.00 | $0.50 | 75% |
| 缓存输入 | $0.20 | $0.05 | 75% |
| 输出 | $10.00 | $2.50 | 75% |
| gpt-6-luna,每 1M tokens | OpenAI 直接价格 | Smart AIPI | 节省 |
|---|---|---|---|
| 输入 | $0.10 | $0.025 | 75% |
| 缓存输入 | $0.01 | $0.0025 | 75% |
| 输出 | $0.50 | $0.125 | 75% |
两款模型还继承了 GPT-6 改进后的提示词缓存功能——更高的默认缓存命中率,以及缓存输入读取 90% 的折扣——因此,重复使用上下文的代理和长对话成本会进一步降低。相同的权重,相同的 OpenAI 兼容 API 形式,相同的工具。唯一的区别是账单。
更高效的协作方式
Sol 和 Luna 继承了 Astra 改进后的沟通风格,这在技术和编码对话中尤其明显:表达更清晰、术语更少、奇怪的措辞更少、低价值细节更少,并且在不损失实质内容的情况下答案略短。实际使用中,这意味着代理不会贸然下结论,更愿意说明自己做了什么、没有检查什么,也更少浪费 tokens 重复显而易见的内容。
如何使用 GPT-6 Sol 和 Luna
Chat Completions API
curl https://api.smartaipi.com/v1/chat/completions \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-6-sol",
"messages": [{"role": "user", "content": "Refactor this module and add tests"}]
}'
支持高推理能力的 Responses API
curl https://api.smartaipi.com/v1/responses \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-6-sol",
"input": "Triage these open issues and open PRs to fix the top three",
"reasoning": {"effort": "high", "summary": "auto"}
}'
Codex CLI、Cursor、Cline、Roo Code、OpenCode、Aider
OPENAI_BASE_URL=https://api.smartaipi.com/v1
OPENAI_API_KEY=sk-your-smart-aipi-key
OPENAI_MODEL=gpt-6-luna
推理工作量支持 low、medium、high 和 xhigh。Sol 和 Luna 会随着工作量设置产生明显的性能变化——上面的 AutomationBench、Agents' Last Exam 和 OSWorld 结果均来自更高的工作量设置。对于长周期代理工作,请使用 high 或 xhigh;对于批量吞吐任务,在 Luna 上使用 low 或 medium 是成本最优的默认选择。
你实际应该运行哪个模型?
- gpt-6-astra——全面最佳。当你想要最优结果和毫不妥协的体验时选择它:计算机使用、浏览器自动化,以及以无人值守完成为目标的长周期重构任务。
- gpt-6-sol——以前沿模型一小部分的成本处理困难工作。在 AutomationBench 上以约为 Claude Opus 5 成本 ~9% 的价格胜过它,并在 DeepSWE 上以约低 80% 的成本达到与 Fable 5 相差不到 1 分的成绩。它是高量代理编码和业务自动化的理想默认选择。
- gpt-6-luna——快速、低成本的层级。在 DeepSWE 上达到接近前沿模型的成绩,同时相比 Opus/Fable 成本降低 90%+。非常适合批量工作、分类、摘要和高吞吐流水线。
三款模型都运行在相同的端点上,并使用相同的密钥。切换只需修改一行,因此请在你自己的工作负载上进行基准测试,而不要盲目相信任何人的图表——包括这张图表。
开始使用
包含免费额度。每个新账户都会获得 $5 免费额度。访问 smartaipi.com/signup 注册,创建 API 密钥,然后立即开始使用 gpt-6-sol 和 gpt-6-luna。无需信用卡。
- 在 smartaipi.com/signup 注册(免费额度,无需信用卡)
- 在控制台中创建 API 密钥
- 将基础 URL设置为
https://api.smartaipi.com/v1 - 使用模型
gpt-6-sol或gpt-6-luna
Astra 级智能,针对成本进行了优化,现已投入生产,价格仅为官方价格的四分之一。