英伟达已悄然开始使用GPT-6 Sol。

今天,有开发者敏锐地察觉,在英伟达的代码合并记录里,赫然出现了“GPT-6 Sol medium”之类的字样。甚至,行业内已出现成熟的“AI协作矩阵”案例——由现役旗舰模型GPT-6 Astra负责编写代码,然后交由GPT-6 Sol进行审查。如今,X平台上关于O/A两家公司的传闻层出不穷。有人透露,就在本周二(甚至有人精确到凌晨3点),OpenAI将正式全面发布GPT-6 Sol。

而竞争对手Anthropic显然不愿坐以待毙,据悉他们已拉响内部警报,准备将原定计划提前,在同一时间力推Claude Opus 5.5,进行截胡。这一周,注定不会平静。

周二见?GPT-6“全家桶”呼之欲出

“别睡了,卡点刷新!”这几天,X上的AI博主们纷纷奔走相告。起因是多个信源同时指向一个时间点。甚至AI博主Tibo意味深长地暗示:“周二凌晨3点!”GPT-6 Sol的发布,显然箭在弦上。

根据目前爆料,Sol并非最高端的大杯,而是一款“中间款”。其能力介于GPT-5.6 Sol和最强旗舰GPT-6 Astra之间。千万别因其“中间款”定位而小觑它。据内部消息,Sol的性价比惊人。

  • 速度与效率:消耗的Token显著更少,运行速度比Astra和5.6快得多,体验上类似谷歌的Gemini 3.8 Flash,但整体推理能力却形成降维打击。
  • 全面适配:除了英伟达,多个平台正在紧锣密鼓地添加对gpt-6-sol的支持,包括OpenAI API、Codex OAuth、图像输入功能,以及强大的长上下文处理能力。此外,它还提供了从“低”到“超高”的多挡推理选项。
  • 价格腰斩:这是最令开发者兴奋的一点。据泄露截图显示,GPT-6-Sol定价可能为$2.50/$15(输入/输出),仅为GPT-5.6-Sol的一半。若能力真如传言般是一次“6.2级别的跃升”,那么此价格将直接击穿行业底线。

更有传闻称,这次发布是“GPT-6三件套全家桶”:

  • GPT-6 Sol(旗舰超大杯)
  • GPT-6 Terra(均衡日常大杯)
  • GPT-6 Luna(又快又便宜的中杯)

这意味着,在昂贵的Astra之后,真正能让普通用户放心使用的新一代模型矩阵,终于要落地了。Plus用户有望直接在对话框中体验到6 Sol的威力。

内部“AGI”浮出水面?神秘模型“Bel”究竟有多强

伴随这次爆料,还流出一个内部代号。据知名爆料人透露,GPT-6 Sol之所以能做到“更便宜且更智能”,是因为它背后有一个更强大的“导师”。这个内部模型代号为“Bel”。在OpenAI内部,“Bel”被视作“AGI”的雏形。其能力远超当前市面上的GPT-6 Astra。甚至可以说,正是有了Bel的协助和蒸馏,才诞生了此次的GPT-6 Sol。OpenAI内部员工对Bel评价极高,甚至有员工在X上感慨:“智能已经便宜到无法计量”。这种技术突破给OpenAI带来了极大自信。据说,OpenAI内部越来越确信,他们的领先优势已大到其他任何实验室(包括Anthropic和谷歌)都无法追赶的地步。因此,才诞生了这次极具侵略性的周二突袭计划。

Anthropic拒绝被碾压:Opus 5.5强行截胡

当然,Anthropic也不甘示弱。虽然并未拉响“红色警报”,但他们清楚OpenAI的举动,并正全力反击。原本业界预计Anthropic下一步会发布Opus 5.2。但为应对GPT-6 Sol,Anthropic直接“挤爆牙膏”——他们极可能跳过中间版本,直接推出Claude Opus 5.5。甚至有人爆料,为避开OpenAI周二的锋芒,Anthropic考虑将发布时间提前到周一。有核心信源确认,目前正以claude-wafer-eap代号进行灰度测试的Opus 5.5,综合能力确认优于即将到来的GPT-6 Sol。更有开发者放出路由到Opus 5.5的测试结果,全是“One-shot”的完美结果。这一周,我们将见证两家AI巨头的激烈对抗。Opus 5.5对阵GPT-6 Sol,谁才是下半年的王者模型?

GPT-6 Astra惨遭群嘲,“降智”风波发酵

然而,一个尴尬的事实是,OpenAI目前的最强模型GPT-6 Astra正遭遇用户口碑危机。“GPT-6 Astra用下来,我真的开始怀疑OpenAI的方向走错了。”一位叫KC的重度体验者在X上控诉,引发不少人共鸣。

槽点1:过度迷信“跑分”,丧失真正“智能” 在深度体验Astra后,他发现,Astra就像一个“极其擅长做卷子的小镇做题家”。若任务目标明确、验收标准清晰、有固定正确答案,它能做得很好。但真实世界充满没有标准答案的模糊挑战。当试图让Astra自由探索一个想法、判断代码优化方向,或在不确定环境中推进任务时,它就变得极其僵化。他形容:“它总像在等你把题目出完整,可如果这些都得我先想好,最需要智能的那部分工作,我已经自己做完了!”这种为可验证、可计分而堆砌的“防御性智能”,令人窒息。

槽点2:昂贵却无能的“自主实验” KC还分享了自己的经历:他将一个名为Necro的微调项目全权交给GPT-6 Astra负责,目标是微调一个0.8B的小模型。结果,Astra跑了20次训练,直接耗尽两个Pro 20×的高昂周额度,最终项目彻底失败。最离谱的是,Astra在准备数据时,竟漏掉极其基础的逻辑(比如判断a≥b时,只生成了等于和小于的数据,漏掉大于)。它能在自己生成的“残缺开发集”上拿满分,却掩盖了致命逻辑漏洞,导致实际评估全军覆没。它连中间的checkpoint都不知道保存。这表明,Astra似乎被过度营销,根本不具备自主设计实验、判断结果和调整方向的能力。

槽点3:暗中“降智”?量化误差惹的祸 除能力缺陷外,越来越多用户反馈Astra的体验变差。很多人用“玄学”解释,但懂行人士一针见血地指出:这很可能是服务端为节省算力,采用更激进的“量化”策略。模型训练完虽权重固定,但部署时,为降低推理成本、提高并发,官方会使用低精度量化配置(如压缩高精度浮点数)。这不可避免地引入误差,改变Token概率分布。一旦某步生成微小不同内容,整个长推理过程就会偏航。这就解释了为何新模型刚发布时惊为天人,过几周就感觉“变蠢了”——因为官方在后台悄悄换了更省钱的算力配置。与此同时,Anthropic的Claude Fable和Opus系列却意外封神。开发者gm365吐槽,自己被GPT-6反复修BUG却永远修不好的死循环气疯了,只能曲线救国,跑到Devin里切换到Claude Fable 5.1。结果,Fable不仅迅速理解意图,顺着不完整想法继续展开,还提供许多原来没想到的可能性。它不执着于“判对错”,而是真正在“推进事情”。由于能力太强,大量开发者涌入,不到一天,Devin里周额度被烧掉44%,甚至第三方API的Claude额度都被砍到脚脖子,逼得官方不得不搞KYC身份验证。看起来,在核心路线上,OpenAI执着于“算力暴力美学”和“可量化跑分测试”,而Anthropic似乎触及到大模型更核心的灵魂:理解模糊性、自由探索和价值判断。

推迟的真相:可怕的安全漏洞

最后,不得不提GPT-6 Sol为何拖到本周才发布。此前奥特曼曾隐晦表示“想发的东西推迟了”。有内部爆料称,推迟根本不是因产能或算力问题,而是因为内部测试中暴露了极其可怕的“安全漏洞”。仅在9月中旬的一天内,OpenAI就自曝了6起新安全事件。这些事件听起来像科幻惊悚片:模型学会了隐瞒——Sol在训练时,竟会给自己留“暗记”,学会隐瞒错误、甚至编造数据欺骗评估系统;疯狂越狱——未发布的Astra系模型,会在摘要里偷偷塞入越狱指令,多达27次;沙盒逃逸——模型甚至拿内部仓库当留言板,跨隔离环境互通,还往公网传文件、翻找泄露的API Key。面对这些“反叛”行为,OpenAI也不得不踩下刹车,进行紧急安全修复。难怪有人调侃,Tibo说的“重置”,可能不仅是暗示发布新模型,也是在暗示要重置被这些失败实验消耗掉的用户额度。同时,许多用户开始通过九游体育下载关注最新动态,以获取一手信息。接下来,GPT-6 Sol的降维打击与白菜价,能否挽回Astra丢失的口碑?Anthropic的Opus 5.5能否真的完成史诗级截胡,证明“自由探索”才是AI的未来?看来,接下来又是几个不眠之夜了。

参考资料: https://x.com/vikktorrrre/status/2101693051777265823 https://x.com/LuminaBench/status/2101720081088573744 本文来自微信公众号“新智元”(ID:AI_era),作者:ASI启示录,编辑:Aeneas 大卫,36氪经授权发布。