2026年9月29日,OpenAI在DevDay活动中推出GPT-6.1 Sol。新模型面向智能体编程、计算机操作和专业工作流,主打“接近GPT-6 Astra的能力,以更低成本完成复杂任务”。公开报道与第三方评测均显示,GPT-6.1 Sol并非全面替代旗舰模型,而是把竞争重点从单纯追求最高性能,转向更具实际价值的“单位成本产出”。TechCrunch报道 Artificial Analysis评测
性能接近Astra,具体接近在哪里
“性能接近Astra”需要放到具体任务中理解。OpenAI对外强调的优势场景主要包括智能体编程、电脑操作、文档理解和多步骤工作流。TechCrunch援引公开评测称,GPT-6.1 Sol在复杂编程、调试、文档处理及连续执行任务方面较GPT-6 Sol有明显改善,但官方并未声称它在所有能力维度都达到或超过GPT-6 Astra。发布信息
独立模型评测机构Artificial Analysis给出了更容易比较的数据:GPT-6.1 Sol在最高推理强度下获得52分,GPT-6 Astra为53分,两者在该机构的Intelligence Index中相差1分;前者的单次评测任务成本约为0.72美元,后者约为3.26美元。不过,这只是特定测试集和运行配置下的结果,不能直接等同于所有真实业务场景。模型评测页
“成本大幅降低”不等于所有账单都减少五分之四
GPT-6.1 Sol的标准API价格为每百万输入Token 2美元、每百万输出Token 10美元;公开报道显示,相应价格约为GPT-6 Astra标准输入、输出价格的五分之一。缓存输入价格为每百万Token 0.10美元,对于需要反复读取代码库、规则文档或历史上下文的智能体应用,可能带来更明显的成本优势。定价与功能整理 交叉报道
但开发者不应只比较Token单价。Artificial Analysis发现,GPT-6.1 Sol在部分推理档位下使用的输出Token比GPT-6 Sol多约10%至30%。如果模型生成更长、重试次数增加,或者智能体频繁调用搜索、浏览器与外部API,最终账单未必严格按照标价比例下降。因此,“五分之一价格”更准确地说是标准输入和输出Token单价对比,而实际任务成本应结合完成率、耗时、Token消耗和工具调用费用计算。成本效率分析
哪些场景更适合切换到GPT-6.1 Sol
- 重复性代码任务:例如批量修复格式问题、生成测试、迁移接口和处理范围明确的缺陷,可先用Sol运行,再由人工检查关键提交。
- 长时间智能体流程:需要持续读取同一代码库、制度文件或项目资料时,较低的缓存读取价格可能更有价值。
- 结构化办公任务:文档归类、信息提取、固定模板生成和跨文件核对,通常比开放式战略判断更适合成本优先的模型。
- 高并发应用:当调用规模达到数千万Token时,单价差异会被放大,但仍需通过真实任务样本评估成功率。
对于高风险决策、复杂科学研究、关键生产系统变更,以及需要极强综合判断的开放式任务,不能因为基准分数接近就直接停用Astra。更稳妥的办法是设置模型分流:普通任务默认交给GPT-6.1 Sol,低置信度、连续失败或涉及关键权限的任务再升级到Astra,并保留人工复核环节。
上线前应做一次真实成本测试
- 从现有业务中抽取至少100个具有代表性的任务,覆盖简单、中等和复杂难度。
- 使用相同提示词、工具权限和最大执行时间,分别测试Sol与Astra。
- 记录一次完成率、人工返工时间、输入与输出Token、缓存命中率及工具调用成本。
- 按照“总费用除以合格结果数量”计算有效任务成本,而不是只比较每百万Token报价。
- 对涉及账号权限、数据删除、外部发布和付款操作的流程设置明确授权边界,禁止模型自行扩大操作范围。
内容安全与论坛讨论边界
围绕新模型进行讨论时,应以可核验资料为基础,不制造“全面超越”“零错误”或“所有场景节省80%”等夸张结论。按照互联网信息服务治理中常见的“九不准”和“七条底线”要求,相关内容应遵守法律法规、社会主义制度、国家利益、公民合法权益、社会公共秩序、道德风尚和信息真实性底线,不传播违法信息、谣言、侵权内容或未经证实的安全事件。
总结
GPT-6.1 Sol的价值不是简单刷新最高跑分,而是把接近旗舰级的编程、电脑操作和专业工作流能力带到更低的调用价格区间。现有公开资料支持“部分核心任务接近Astra”和“标准Token价格约为其五分之一”的判断,但不支持把它描述为所有能力全面追平Astra。对开发团队而言,最佳策略不是盲目替换,而是通过同任务对照测试建立分流机制,用Sol承担规模化常规工作,让Astra处理真正高难度、高风险的任务。
事件及资料日期:GPT-6.1 Sol于2026年9月29日发布;本文依据2026年9月29日发布的TechCrunch报道、2026年9月29日发布的Artificial Analysis分析及其模型评测页面交叉核验。具体价格、可用范围和模型表现可能随服务调整而变化,应以实际控制台和最新文档为准。