让AI Agent「试玩」世界模型,长程目标评测有了新基准PlayWorld
让AI Agent「试玩」世界模型,长程目标评测有了新基准PlayWorld世界模型应该如何评测?答案是:像真实用户一样去 “玩” 它。
搜索
世界模型应该如何评测?答案是:像真实用户一样去 “玩” 它。
就在刚刚,OpenAI神秘双响炮泄露,打响与Claude争霸的下一战!
在 AI 时代,只要你学得足够慢,你就可以不用学。年初 OpenClaw 最火的时候,为了养一只「龙虾」,有人专门买 Mac mini,有人从命令行开始补课,装环境、配模型、研究 Skill,顺便再和各种报错斗智斗勇。
真正的智能,在于能否基于有限的数据,实现可靠的泛化与迁移。
8月18日,一篇系统梳理单细胞基础模型的综述预印本挂上 Preprints.org(doi:10.20944/preprints202608.1166.v1),标题是《The Landscape of Single-Cell Foundation Models: Design Principles, Applications, and Open Challenges》,尚未经过同行评审。
2024 年,Boris Cherny 加入 Anthropic 时,AI 编程产品大多还停留在代码补全和对话问答阶段。模型已经能够写出完整的函数和文件,但产品通常只允许它在编辑器里提出建议,很少真正赋予它读取代码库、修改文件和调用终端的能力。
AI视频领域一笔超大额融资浮出水面。
据 Business Insider 报道,人工智能开源平台 Hugging Face 正探索出售事宜,交易估值有望达到 130 亿美元(约合人民币 876.6 亿元)。该公司总部位于纽约,目前托管着大量开源大语言模型和数据集,并已聘请投行协助评估潜在竞购方意向。
香港大学、香港科技大学与腾讯 ARC Lab 联合提出 SCoPE(Sightline-Coordinate Positional Encoding),一套面向视频 DiT 的射线空间位置编码:让视频模型处理位置关系的基底从张量网格转向射线空间。
Anthropic又有两张「新牌」,被提前掀开了!今天,第三方开发者应用和Discord社区中,接连出现了两个陌生的模型ID——claude-mashmallow-eap(棉花糖) 和claude-melon-eap(甜瓜)