Eval丨 我们做了个“你画我猜 Benchmark” :1350 张图后,GPT-6 险胜
Eval丨 我们做了个“你画我猜 Benchmark” :1350 张图后,GPT-6 险胜我们自建的"你画我猜 Benchmark"第一期用150个词、1350张SVG画作对8款模型进行互画互猜测试,最终GPT-6 Astra以75.5分险胜Gemini 3.8 Flash与Claude Fable 5.1,结果显示思考更多或花费更多的模型并未稳定取得更高分,且部分模型连自己的画都认不出。
搜索
我们自建的"你画我猜 Benchmark"第一期用150个词、1350张SVG画作对8款模型进行互画互猜测试,最终GPT-6 Astra以75.5分险胜Gemini 3.8 Flash与Claude Fable 5.1,结果显示思考更多或花费更多的模型并未稳定取得更高分,且部分模型连自己的画都认不出。
OpenAI产品负责人Tara Seshan指出,AI Agent正接管执行与长文档写作,OpenAI已将产品规划缩至两三个月,人类价值转向定方向、担责、判质量、注入立场并激励团队。
腾讯WorkBuddy、阿里QwenWork等中国大厂AI办公产品出海面临获客成本高企、难以撼动Claude Code和Codex等海外成熟工具用户心智、品牌信任与数据合规门槛较高以及本地化不足等现实阻力,尽管中国AI模型凭借性价比在海外广受欢迎,国产AI办公Agent却尚未打开海外市场。
文章指出AGI与AI正以"任务拆解"方式削平职业中间层,使稳定职业收缩、新人入口变窄、身份失去锚点,并建议未来十年应以"造工作"替代"找工作",回归判断、在场、关系等不可复制要素,建立独立可定价的个人头寸以度过过渡期。
TikTok SRE 技术负责人 Salman Munaf 在演讲中指出,AI Agent 一旦调用外部服务就演化为分布式系统,开发者必须引入请求标识符、幂等键、状态查询、熔断器、范围权限与可观测性等工具,并将记忆视作缓存、审批绑定具体参数,才能避免重试风暴和不可逆事故。
工信部印发《关于开展人工智能应用服务商培育专项行动的通知》,明确到2027年底建成不少于3000家服务商的全国资源池,并通过资源池认证、应用服务团组建、"小快轻准"产品开发、采购与出海支持等举措,为民营企业提供明确政策机遇。
蚂蚁数科资深技术专家魏长征在 AICon 大会上分享 Harness 工程实践,指出 AI Coding 的关键不是写得更快要让产出可验收,并在 40 万行 Rust 新项目和 60 万行 C++ 存量项目中分别通过内建 Harness 和先补齐文档与 CI 门禁实现质量闭环,后者缺陷率从 20% 以上降至个位数。
不得了!国产大模型第一梯队,最近爆了个冷门。
20多年前,计算神经学家杰夫·霍金斯写道:“智能不只是模式识别,更是对世界的建模。”如今,世界模型正在批量迎来自己的里程碑时刻。
这年头,不光人上班要找搭子,AI也开始组队了。