Eval丨 我们做了个“你画我猜 Benchmark” :1350 张图后,GPT-6 险胜
Eval丨 我们做了个“你画我猜 Benchmark” :1350 张图后,GPT-6 险胜我们自建的"你画我猜 Benchmark"第一期用150个词、1350张SVG画作对8款模型进行互画互猜测试,最终GPT-6 Astra以75.5分险胜Gemini 3.8 Flash与Claude Fable 5.1,结果显示思考更多或花费更多的模型并未稳定取得更高分,且部分模型连自己的画都认不出。
搜索
我们自建的"你画我猜 Benchmark"第一期用150个词、1350张SVG画作对8款模型进行互画互猜测试,最终GPT-6 Astra以75.5分险胜Gemini 3.8 Flash与Claude Fable 5.1,结果显示思考更多或花费更多的模型并未稳定取得更高分,且部分模型连自己的画都认不出。
ChatGPT面向在读大学生推出4个月免费Plus优惠(截止10月31日),本文实测两种领取方法,详解SheerID学生身份验证、Plus订阅及激活领取的完整流程,并建议在当前订阅快到期时再激活以避免覆盖已付费月份。
Superdesign 近日在 Codex(ChatGPT)插件市场上线官方插件,可让 Codex 自动扫描项目设计资产并在右侧画布流式渲染 UI,Agent 还会自检迭代,用户选定后一键将设计代码应用回本地项目。
在Epoch AI与曼彻斯特大学发布的FrontierMath Erdős基准测试中,GPT-6 Astra以3%得分率成为唯一非零分模型并解开5道Erdős难题,而GPT-5.6 Sol、GPT-5.5、Fable 5.1与Claude Fable 5均交白卷。
实测首个AGI级别模型GPT-6,用一张白宫照片在22分钟内生成可自由漫游和调光的三维场景,并完成秦始皇骑北极熊的SVG动画、一句话制作马里奥风格赛车游戏及模仿孙宇晨风格的短文写作,展现其根据简短需求主动补全细节的能力。
微软开始倒查员工AI账单,有员工28天内烧掉2.8万美元(约19万元人民币)token,公司因此推行部门预算、个人支出仪表盘等管控措施,并将默认模型切换为OpenAI的GPT-5.6 Sol。
Manus团队在评测模型深度研究报告质量时,构建了"信息量"与"隐喻率"两项指标,分别通过抽取事实点和统计每百句隐喻数量来衡量信息密度与文风易读性,在覆盖9个主流模型36道题目的Research Bench测试中发现Claude Fable-5隐喻率最高、GPT旗舰模型信息密度低于Claude系列。
就在刚刚,GPT-6 Astra 毫无预警地全量上线。GPT-6 Astra 已经正式面向 ChatGPT Work 以及 Codex 的 Pro、Enterprise 和 Business Premium 用户同步开放,API 接口也已经全部就绪。
OpenAI 的 GPT-6 Astra 在有界素数间隔问题上将上界从 246 推进至 186,并完成 Lean 形式化验证,显示 AI 正从数学解题工具走向研究伙伴。
新版生图模型GPT Image 2.5虽未正式发布,但已通过ChatGPT弹窗提示向部分用户开放,该模型生成图像极为逼真,已能伪造GPT-6官方发布会和奥特曼全员信等场景,并在生成速度、角色一致性、文字渲染等方面较GPT Image 2有显著提升。