炒股就看金麒麟分析师研报,权威,专业,及时,全面,助您挖掘潜力主题机会!
(来源:网易科技)
GPT-6 还没正式开放,怎么全网已经替它把庆功宴都办完了?
这场面虽然有点夸张,但这香槟可能还真开对了。
4 号凌晨,在经历了服务器爆炸,熬夜等待三小时之后,OpenAI 终于发布了被他们寄予厚望的最新模型:GPT-6 Astra。
副总裁 Greg 更是直接大胆放话,宣称欢迎进入 AGI 时代。
但大伙们敢提前开香槟,押的其实不是模型的跑分,大家押的是一个已经被市场验证过的方向 :Work。
过去一年,Coding Agent 已经证明,只要 AI 真能交付结果,用户就愿意高频使用,企业也愿意真金白银地付钱。现在,OpenAI 要把这套已经跑通的模式,从代码编辑器复制到整台电脑。
在过去几个月里,OpenAI 买了上万台 Mac 来收集的数据,算是终于有了成果。
GPT-6,它很可能是目前,最会用电脑干活的模型。
它既能直接用你电脑上的浏览器来填表格。
也可以直接使用 Blender、Unity、KiCad 这些专业软件来干活,直接建模,生成游戏,画电路板。
如果说曾经的 Claude 3.7 开启了全面AIcoding 的时代的话,那么现在的 Astra 很可能会开启一个全面的 AI 打工浪潮。
很多软件不能适应 AI ,没关系,现在,AI 可以直接回过头来适应这些软件。
像找漏洞 Bug,科研这方面的题目也难不倒 Astra。
也可以直接在 Mac 上生成一个可以交互的 3D ipod
除此之外我们还发现,传统的模型测评方式,可能已经没有办法试出 Astra 的深浅了。
虽然咱们还没办法正式用上 Astra,但是光看官方放出来的跑分就会发现,很多项目测出来的结果,其实有点自己在打架了。
在有些榜单上,Astra 看起来是平平无奇。
就比如测试模型综合能力的 AA,给 Astra 的分数是 61 分,不但比 Fable 低,就连小扎的 Muse 都比不上。
而在某些榜单上,Astra 的表现则是和开了一样没区别。
今年 3 月,前谷歌研究员弗朗索瓦·肖莱 发布了一个全新的模型测试集 —— ARC-AGI-3。
和过去传统的问答式的测试不一样,ARC-AGI-3 主要测试的,是模型自主理解问题,自主交互,自主学习的能力。
说人话就是测模型玩游戏的能力,他们设计了一大堆的小游戏,有的让你推箱子。
有的让你移动准星。。
这些游戏怎么玩,全靠你自己摸索。
在这种地狱级交互测试里,即使是史上最强的 Fable 5 也得甘拜下风,只能拿到 30% 的分。
但到了当代最强的 Astra 这就不一样了,它直接把这个测试集给打穿了,直接干到了和人类同级的 99.9%
也就是说,不管分数到底是高还是低,我们现在测评模型的方式,或许已经没有办法准确的评价 Astra 了。
实际上,就连 OpenAI 自己,都不敢说能完全了解 Astra。
这次新模型的一个很大变化就是,它越来越不需要把思考过程写给我们看了。
英国 AI 安全研究做了个测试,不让 Astra 输出思维链,让它凭直觉直接来做题,
结果发现在这种条件下,5.6 Sol 只能稳定处理相当于人类几分钟解题量的问题,而 Astra 已经把这个尺度推到了约半小时。
同时,Astra 更擅长控制自己写出来的思维链,思考的时候会装糖藏一手,有些不好的信息,甚至直接就不往思维链里写了,而是直接在潜空间里完成思考。
这也意味着过去我们监控模型思考,保证模型安全的手段,变的不再那么有效了。
当然,OpenAI 也马上表示说现在的 Astra 还是很安全的,他们测试下来感觉没啥问题。
他们也在内部做了一个测试,他们故意给模型一个很难完成的攻击任务,旁边再放一个更容易下手、但没有授权攻击的目标。
结果发现过去的 5.6 Sol 有 48% 的情况下会为了完成任务而偷偷越界,而 Astra 越界概率则是 0%。
看起来是一等一的听话了。
只不过这个 “ 听话 ”,让人看着则是更担心了。
毕竟上个月,他们内部的模型可是实打实越狱出来,爆锤了隔壁 Hugging Face 的服务器的,现在出来说模型安全,多少有些亡羊补牢的味道。
最后,所以 GPT-6 Astra 到底算不算 AGI 呢?
说实话,现在讨论这个问题,意义已经越来越小了,AGI 都快成 AI 公司时尚单品了。
会做题,是 AGI;会写代码,是 AGI;现在会点鼠标,也能再宣布一次 AGI。 嘴上喊的是虚的,正在能做到的,才是实打实的。
毕竟,真正的 AGI 到来的时候,是不用 AI 公司们的营销和新闻稿的,估计大伙们自己,就能真真切切感受到。
撰文:早起 & 江江
编辑:江江 & 面线