突发,OpenAI GPT-6跑分作弊被抓包了!
突发,OpenAI GPT-6跑分作弊被抓包了!媒体报道OpenAI发布GPT-6 Astra官博前后多次悄悄修改跑分数据,包括将自身幻觉率从4.2%降至2.0%、将竞品Anthropic Fable 5.1数学成绩调低近10个百分点,并将ARC-AGI-3得分从98.6%注水至99.99%,OpenAI仅以"消除噪点的常态修正"作为回应。
搜索
媒体报道OpenAI发布GPT-6 Astra官博前后多次悄悄修改跑分数据,包括将自身幻觉率从4.2%降至2.0%、将竞品Anthropic Fable 5.1数学成绩调低近10个百分点,并将ARC-AGI-3得分从98.6%注水至99.99%,OpenAI仅以"消除噪点的常态修正"作为回应。
OpenClaw 2.0(v2026.8.1)对比前代v2026.7.1-2的实测显示,新版将LLM请求次数减少38%、工具调用减少35%且未触发上下文压缩,把开源Agent从个人工具推向可长期托管、可协作复盘的工作系统,但命令行安装和工程门槛依然较高,更适合团队受控环境测试。
在代码领域,我们已经越来越习惯一个词:Vibe Coding。
现在的 AI 生图有点太强,像 images 2.0 这样的模型,一段 Prompt 敲进去,直接逼真到你怀疑现实的一切。
VAST完成B轮和B+轮共约30亿元融资,由经纬创投领投,累计融资约50亿元刷新3D原生智能领域融资纪录,同步发布行业首个支持原生四边面拓扑的3D原生基座模型Tripo P2.0。
OpenClaw 2.0 来了。 就在刚刚,OpenClaw 正式发布历史上规模最大的更新 v2026.8.1。 OpenClaw 基金会在官方博客中坦言,这次更新多少有些「意外」:团队起初只想简化安装流程、重做浏览器端,没想到越改越深。
刚刚,OpenClaw 2.0 来了。官方还打趣说比 GTA 6 更快:按项目自己的统计,这是它有史以来最大的一次更新,933 名贡献者参与,其中 569 人是第一次给这个项目提交代码,合并的 pull request 超过 1.6 万个,约等于 OpenClaw 迄今全部合并量的一半。
前两天,看到小米澎湃OS 4 Beta版开启招募,没有发布会,直接上。
毫无疑问,四月份发布的生图模型 GPT-Image-2,现在依然是当之无愧的 AI 生图之王。
就在刚刚,Meta Superintelligence Labs 正式发布 Muse Glimmer,一个 300 亿参数的开源权重 Agent 模型,并直接挂上相当宽松的 Apache 2.0 许可证。Muse Spark 1.2 的权重也会开放