斯坦福实验实锤: 魔改后的DS V4 Flash干翻Fable 5
斯坦福实验实锤: 魔改后的DS V4 Flash干翻Fable 5同样的模型,同样的任务,让它执行五遍,再让他自己挑一遍最稳的,效果能有多大提升?斯坦福把这套玩法用在了AI身上,DeepSeek V4 Flash在Terminal-Bench 2.1的成绩从79%一路涨到88%,反超了尖子生Fable 5。而且连做五遍加挑选这一通折腾,价格依然比Fable 5便宜了4-11倍。
搜索
同样的模型,同样的任务,让它执行五遍,再让他自己挑一遍最稳的,效果能有多大提升?斯坦福把这套玩法用在了AI身上,DeepSeek V4 Flash在Terminal-Bench 2.1的成绩从79%一路涨到88%,反超了尖子生Fable 5。而且连做五遍加挑选这一通折腾,价格依然比Fable 5便宜了4-11倍。
老黄,真的不甘心只做卖铲人了!
这两年,互动娱乐先在线下火了一轮。
最近,一支法国科研团队干了一件听起来像赛博朋克小说开场的事:把来自死后供体的成人脑切片泡在培养皿里,接上一只机械手和一个麦克风。相关论文的标题是:《人类大脑离体培养物的无监督感觉-运动关联学习,使机器人实现动作模仿》。
全球 AI 视频创作的注意力,全都被模型厂商以及少数 C 端产品所霸占。
全世界刷屏的“牛来大模型”,到底是谁家的牛?
A社的王牌旗舰Fable 5,卖不动了。
今年8月,谷歌首席科学家Jeff Dean宣布离职,创办AI4S公司Discovery Loop。
近来文生图模型发展迅速,但每篇工作多是独立地引入一整套模型、数据和训练设计,然后用私有的数据训出来了一个亮眼的模型。
世界模型应该如何评测?答案是:像真实用户一样去 “玩” 它。