Eval丨 我们做了个“你画我猜 Benchmark” :1350 张图后,GPT-6 险胜
Eval丨 我们做了个“你画我猜 Benchmark” :1350 张图后,GPT-6 险胜我们自建的"你画我猜 Benchmark"第一期用150个词、1350张SVG画作对8款模型进行互画互猜测试,最终GPT-6 Astra以75.5分险胜Gemini 3.8 Flash与Claude Fable 5.1,结果显示思考更多或花费更多的模型并未稳定取得更高分,且部分模型连自己的画都认不出。
搜索
我们自建的"你画我猜 Benchmark"第一期用150个词、1350张SVG画作对8款模型进行互画互猜测试,最终GPT-6 Astra以75.5分险胜Gemini 3.8 Flash与Claude Fable 5.1,结果显示思考更多或花费更多的模型并未稳定取得更高分,且部分模型连自己的画都认不出。
Manus团队在评测模型深度研究报告质量时,构建了"信息量"与"隐喻率"两项指标,分别通过抽取事实点和统计每百句隐喻数量来衡量信息密度与文风易读性,在覆盖9个主流模型36道题目的Research Bench测试中发现Claude Fable-5隐喻率最高、GPT旗舰模型信息密度低于Claude系列。
正常人看到这些东西,一般会经历短暂的宕机,先愣一下,再看一遍,然后想想是不是自己脑子有问题。然后开始怀疑自己为什么要看这玩意。GPT不一样,AI 那时候还是很有职业道德的。用户既然问了那它就倾向于回答,然后会调动知识、整理逻辑,一本正经地开始解释
最近,「越狱」这个有点古典的词,又在 AI 圈火了起来。7 月,OpenAI 在进行模型测试时,GPT-5.6 Sol 和另一款待发布的模型,攻击了第三方开源平台 Hugging Face。先是 Hugging Face 自己发布了报告,提到相关服务遭到了完全由 AI Agent 组织的大规模网络攻击;随后 OpenAI 出来认领,「我就是那个发起攻击的 AI 模型。」
昨天,大名鼎鼎的 Claude 4.8 发布了。 科技圈照例是一片欢呼。 看官方放出来的一堆评测数据,依然是碾压级别的,尤其是说代码(Coding)能力有了史诗级的提升,简直像交了一份满分答卷。
Bloomberg 曝出重磅消息:Trump 政府正在起草一份全新 AI 安全行政令。草案中没有强制模型测试条款,也不会要求前沿 AI 模型在发布前获得政府批准,取而代之的核心方向是「自愿合作」。从 Biden 时代的强制红队测试报告机制,到如今强调企业自愿参与网络防御——美国 AI 安全监管正在经历一次路线级别的转向。
全网AI交白卷的地狱级基准,被GPT-5.5拿下一血!开局0源码盲写程序,拉满推理算力直接满血通关。传统代码测试已废,通往ASI的算力狂飙正式打响。
SWE-Bench 的创建者,刚刚又放出了一个地狱级新 benchmark。
SWE-Bench上能拿72%的模型,换张考卷直接归零!Meta联合斯坦福、哈佛放出ProgramBench,200个项目从零手写,9大顶级模型完整通过率0%。最强的Claude Opus 4.7平均通过率也才51.2%。更离谱的是一联网,就有模型在36%的任务里跑去GitHub扒源码。
近日,ARC Prize 官方发布了针对这两款顶级模型的详细分析报告,结果令人震惊:在面对未见过的逻辑任务时,两者的表现得分均低于 1%,GPT-5.5 得分 0.43%,Claude Opus 4.7 得分 0.18%。