刚刚,Claude 5.1 发布!全球最强模型来了
刚刚,Claude 5.1 发布!全球最强模型来了Anthropic 发布 Claude Fable 5.1 和 Claude Mythos 5.1,Fable 5.1 多项基准测试超越上一代,缓存读取成本降低 75%,典型任务整体费用降低约 25%、高 Agent 化任务最高降低约 45%,Mythos 5.1 则面向经审核的高风险领域合作伙伴提供更宽松能力并采用更严格的访问控制。
搜索
Anthropic 发布 Claude Fable 5.1 和 Claude Mythos 5.1,Fable 5.1 多项基准测试超越上一代,缓存读取成本降低 75%,典型任务整体费用降低约 25%、高 Agent 化任务最高降低约 45%,Mythos 5.1 则面向经审核的高风险领域合作伙伴提供更宽松能力并采用更严格的访问控制。
OpenAI内部代号mozaik-alpha-fdm的Astra模型扩大灰度测试,其在Max effort模式下展现的零样本前端与3D网页一次生成能力引发开发者惊叹,预计9月3日前后正式发布以正面硬刚Anthropic的Fable 5.1。
Claude Code内置的安全降级机制严重翻车,开发者在使用AI编程工具Fable 5编写临时文件清理脚本时触发对抗性审查,模型被先后从Fable 5降级至Opus 5再到Opus 4.8,最终因变量复用错误导致Opus 4.8误删开发者Guillemot的整个主目录,700GB数据丢失。
今夏,数学圈震动不断——OpenAI的Astra模型一举解决10个长期悬而未决的数学问题(包括非sofic群的存在、高维球堆积新的结果等);Claude Fable 5找到近百年Jacobian猜想的反例,之后还极大推动了黎曼猜想!
Fable 5.1这周鸽了,但A社再次甩出了王炸。 今天,是值得载入大模型史册的一天。 AI,终于长出手,接管物理世界了! A社最先拿自家Claude「试水」,让它去真正操控实验室的硬件。
随着开源模型能力不断提升,它们已经能够以极低的成本生成多个高质量候选方案,并进一步利用模型自身对这些结果进行验证、打分和筛选。斯坦福团队最新实验发现,使用 DeepSeek V4 Flash + LLM-as-a-Verifier 进行「自验证」,可以在 Terminal-Bench 2.1 上超越 Claude Fable 5,同时整体成本低约 11 倍。
就在今天一大早,全网都被刷屏了。 内部人士爆料:Fable 5.1马上就要来了! 最快,很可能明天就会发布。 而且,Fable 5.1和Sonnet 5.1很可能将同时发布。 消息的源头,
同样的模型,同样的任务,让它执行五遍,再让他自己挑一遍最稳的,效果能有多大提升?斯坦福把这套玩法用在了AI身上,DeepSeek V4 Flash在Terminal-Bench 2.1的成绩从79%一路涨到88%,反超了尖子生Fable 5。而且连做五遍加挑选这一通折腾,价格依然比Fable 5便宜了4-11倍。
A社的王牌旗舰Fable 5,卖不动了。
Anthropic又有两张「新牌」,被提前掀开了!今天,第三方开发者应用和Discord社区中,接连出现了两个陌生的模型ID——claude-mashmallow-eap(棉花糖) 和claude-melon-eap(甜瓜)