ARC-AGI-3近被完美攻破,这个Harness能让AI掌握物理学家思维
ARC-AGI-3近被完美攻破,这个Harness能让AI掌握物理学家思维7 月 16 日,伯克利博士后 Haven Feng 的一条推文火了。原因无他,结果很震撼:在 ARC-AGI-3 Public 集上,一套名为 [schema] 的智能体框架,与 Claude Opus 4.8、Fable 5 组合后达到 98.98% 的 RHAE;换成 GPT-5.6 Sol 组合,分数也有 95.35%。
搜索
7 月 16 日,伯克利博士后 Haven Feng 的一条推文火了。原因无他,结果很震撼:在 ARC-AGI-3 Public 集上,一套名为 [schema] 的智能体框架,与 Claude Opus 4.8、Fable 5 组合后达到 98.98% 的 RHAE;换成 GPT-5.6 Sol 组合,分数也有 95.35%。
今天凌晨看到 Arena AI 更新 Code Arena 榜单时,我第一反应是有点意外。刚刚发布的 Kimi K3 拿到了 1679 分,排在全球第一,压过了 Claude Fable 5 的 1631 分和 GPT-5.6 Sol 的 1618 分。
还得是厂商内卷,造福用户啊……AI圈也迎来了自己的百亿补贴。
之前折腾过各种图片滤镜,ASCII 码、圆点、像素风,做出来觉得有意思,但光做滤镜的工具太多了,没什么记忆点。刚好这阵子"人生新成就""地球 Online 成就"在社交媒体上很火。大家把自己的真实经历写成游戏成就的格式,配一个稀有度和达成率,有点自嘲又有点骄傲。
GPT-5.6 Sol 惊现毁灭级Bug,竟随机清空电脑硬盘!硅谷大佬Matt Shumer惨遭背刺,Mac中的心血全毁,愤怒发帖控诉,正在试图恢复。开发者大神们,纷纷祭出保命指南。
就在刚刚,GPT-5.6 系列正式登场,一口气发布三个型号:旗舰 Sol、均衡款 Terra,还有主打性价比的 Luna,名字分别取自拉丁语里的太阳、地球/大地和月亮。价格上,Sol 每百万 token 输入 5 美元、输出 30 美元;Terra 直接减半,2.5 美元和 15 美元;Luna 最便宜,只要 1 美元和 6 美元。
大语言模型在代码生成上的能力不断增强,但在复杂算法题,尤其是竞赛编程场景中,仍然容易因为算法选择错误、边界条件遗漏、复杂度判断失误或隐藏测试覆盖不足而失败。Solvita是一款面向竞赛编程的智能体框架,通过四个角色(Planner、Solver、Oracle、Hacker)形成闭环系统,并利用可训练的图结构知识网络积累经验。
MrFlow(Multi-Resolution Flow Matching)就用这样的三阶段,在Qwen-Image等模型上把端到端生成时间从49.32s压到4.77s,实际加速10.35x。文章发布当日即登上Hugging Face Daily Papers;发布三天内,GitHub已收获200+stars;目前也已登上Hugging Face Trending Papers。
GitHub上有个项目叫 Project N.O.M.A.D,33k Star,3k Fork。作者 Chris Sherwood 是个搞网络设备的 YouTuber,Crosstalk Solutions 频道有 38 万多订阅。这项目说白了就是把维基百科、本地 AI、离线地图、离线教育平台全塞进 Docker 里,断网也能用。
GPT-5.6 Sol预览版发布小半个月了,首批用户内测报告终于新鲜出炉!英伟达首席工程师用最直白最不绕弯子的话告诉你:Sol很猛!30小时,就跑赢了Opus 64小时才达到的CUDA加速效果。后续版本优化后,或将彻底碾压Opus……