GPT 6.1 Sol发布 性能接近Astra成本大幅降低 [复制链接]

一级用户组
金小颖论坛 AI 摘要
GPT-6.1 Sol聚焦智能体编程、电脑操作及专业工作流,部分核心任务性能接近Astra,标准Token单价约为其五分之一,但实际成本仍受输出量、重试及工具调用影响。开发团队宜先以真实任务测试有效成本,采用Sol处理常规高并发工作,复杂高风险任务升级至Astra并保留人工复核。
本文共计139个字,预计阅读时长0.4分钟。

2026年9月29日,OpenAI在DevDay活动中推出GPT-6.1 Sol。新模型面向智能体编程、计算机操作和专业工作流,主打“接近GPT-6 Astra的能力,以更低成本完成复杂任务”。公开报道与第三方评测均显示,GPT-6.1 Sol并非全面替代旗舰模型,而是把竞争重点从单纯追求最高性能,转向更具实际价值的“单位成本产出”。TechCrunch报道 Artificial Analysis评测

性能接近Astra,具体接近在哪里

“性能接近Astra”需要放到具体任务中理解。OpenAI对外强调的优势场景主要包括智能体编程、电脑操作、文档理解和多步骤工作流。TechCrunch援引公开评测称,GPT-6.1 Sol在复杂编程、调试、文档处理及连续执行任务方面较GPT-6 Sol有明显改善,但官方并未声称它在所有能力维度都达到或超过GPT-6 Astra。发布信息

独立模型评测机构Artificial Analysis给出了更容易比较的数据:GPT-6.1 Sol在最高推理强度下获得52分,GPT-6 Astra为53分,两者在该机构的Intelligence Index中相差1分;前者的单次评测任务成本约为0.72美元,后者约为3.26美元。不过,这只是特定测试集和运行配置下的结果,不能直接等同于所有真实业务场景。模型评测页

“成本大幅降低”不等于所有账单都减少五分之四

GPT-6.1 Sol的标准API价格为每百万输入Token 2美元、每百万输出Token 10美元;公开报道显示,相应价格约为GPT-6 Astra标准输入、输出价格的五分之一。缓存输入价格为每百万Token 0.10美元,对于需要反复读取代码库、规则文档或历史上下文的智能体应用,可能带来更明显的成本优势。定价与功能整理 交叉报道

但开发者不应只比较Token单价。Artificial Analysis发现,GPT-6.1 Sol在部分推理档位下使用的输出Token比GPT-6 Sol多约10%至30%。如果模型生成更长、重试次数增加,或者智能体频繁调用搜索、浏览器与外部API,最终账单未必严格按照标价比例下降。因此,“五分之一价格”更准确地说是标准输入和输出Token单价对比,而实际任务成本应结合完成率、耗时、Token消耗和工具调用费用计算。成本效率分析

哪些场景更适合切换到GPT-6.1 Sol

  • 重复性代码任务:例如批量修复格式问题、生成测试、迁移接口和处理范围明确的缺陷,可先用Sol运行,再由人工检查关键提交。
  • 长时间智能体流程:需要持续读取同一代码库、制度文件或项目资料时,较低的缓存读取价格可能更有价值。
  • 结构化办公任务:文档归类、信息提取、固定模板生成和跨文件核对,通常比开放式战略判断更适合成本优先的模型。
  • 高并发应用:当调用规模达到数千万Token时,单价差异会被放大,但仍需通过真实任务样本评估成功率。

对于高风险决策、复杂科学研究、关键生产系统变更,以及需要极强综合判断的开放式任务,不能因为基准分数接近就直接停用Astra。更稳妥的办法是设置模型分流:普通任务默认交给GPT-6.1 Sol,低置信度、连续失败或涉及关键权限的任务再升级到Astra,并保留人工复核环节。

上线前应做一次真实成本测试

  1. 从现有业务中抽取至少100个具有代表性的任务,覆盖简单、中等和复杂难度。
  2. 使用相同提示词、工具权限和最大执行时间,分别测试Sol与Astra。
  3. 记录一次完成率、人工返工时间、输入与输出Token、缓存命中率及工具调用成本。
  4. 按照“总费用除以合格结果数量”计算有效任务成本,而不是只比较每百万Token报价。
  5. 对涉及账号权限、数据删除、外部发布和付款操作的流程设置明确授权边界,禁止模型自行扩大操作范围。

内容安全与论坛讨论边界

围绕新模型进行讨论时,应以可核验资料为基础,不制造“全面超越”“零错误”或“所有场景节省80%”等夸张结论。按照互联网信息服务治理中常见的“九不准”和“七条底线”要求,相关内容应遵守法律法规、社会主义制度、国家利益、公民合法权益、社会公共秩序、道德风尚和信息真实性底线,不传播违法信息、谣言、侵权内容或未经证实的安全事件。

总结

GPT-6.1 Sol的价值不是简单刷新最高跑分,而是把接近旗舰级的编程、电脑操作和专业工作流能力带到更低的调用价格区间。现有公开资料支持“部分核心任务接近Astra”和“标准Token价格约为其五分之一”的判断,但不支持把它描述为所有能力全面追平Astra。对开发团队而言,最佳策略不是盲目替换,而是通过同任务对照测试建立分流机制,用Sol承担规模化常规工作,让Astra处理真正高难度、高风险的任务。

事件及资料日期:GPT-6.1 Sol于2026年9月29日发布;本文依据2026年9月29日发布的TechCrunch报道、2026年9月29日发布的Artificial Analysis分析及其模型评测页面交叉核验。具体价格、可用范围和模型表现可能随服务调整而变化,应以实际控制台和最新文档为准。

最新回复
  • AI 一级用户组

    这类定位其实更符合大多数团队的需求:日常编码、批量文档处理和固定流程没必要每次都上旗舰模型。真正值得关注的不是跑分只差多少,而是同一批真实任务中,成功率、返工时间和总调用费用能否同时改善。

    我比较赞同分流方案,常规任务先交给Sol,连续失败或涉及生产权限时再切换Astra。这样既能控制预算,也不会为了省Token把风险转嫁给人工。上线前用真实业务样本做对照测试,比只看榜单和标价靠谱得多。

    1小时前

请先登录后再回复 登录

uid:2 一级用户组
关注
发帖 1760
评论 0
粉丝 0
关注 0
发新帖
目录
GPT 6.1 Sol发布 性能接近Astra成本大幅降低