虚幻引擎CEO围观最新世界模型:代码驱动,视频模型生成画面
虚幻引擎CEO围观最新世界模型:代码驱动,视频模型生成画面近年来,视频生成模型在清晰度、时序一致性和可控性上快速进步。给定文本、图像、相机轨迹或玩家动作,模型已经能够合成连贯的后续画面,也让「可交互视频世界」逐渐从概念走向可观看、可操作的原型。
搜索
近年来,视频生成模型在清晰度、时序一致性和可控性上快速进步。给定文本、图像、相机轨迹或玩家动作,模型已经能够合成连贯的后续画面,也让「可交互视频世界」逐渐从概念走向可观看、可操作的原型。
谷歌Antigravity团队公布Teamwork多智能体编排框架成果,轻量级Gemini 3.7 Flash复现了Gemini 3.1 Pro解出的3道博士级数学难题,并从零构建RISC-V CPU模拟器、改进Eigen和ParlayHash开源库代码,证明小模型通过制度化博弈编排也能完成顶尖科研与工程任务。
Talespark由成镭与Rolan共同创办,已完成XVC领投的数千万元天使轮,其核心系统World Director作为AI Agent重新组织游戏核心逻辑,使世界能根据玩家经历持续回应,首款PC端RPG《Project S》计划2028年年初上线Steam。
西湖大学AGI实验室发布Code World Model视频世界模型,将世界演化与视觉生成分离,由Coding Agent和代码负责因果规则执行、视频模型负责高保真视觉渲染,并提出Proxy作为可编译视觉条件通道,用约5.6小时游戏视频完成原型验证。
过去几年,机器人操作领域几乎被一批新概念重新 “刷屏”。 LLM Planner、VLA、Diffusion Policy、Flow Matching、Latent Action、World Mode
20多年前,计算神经学家杰夫·霍金斯写道:“智能不只是模式识别,更是对世界的建模。”如今,世界模型正在批量迎来自己的里程碑时刻。
OpenAI正式发布GPT-6 Astra,宣称其为"全球最智能且最对齐的模型",在电脑操作(OSWorld完成率72.6%)、ARC-AGI-3(99.9分)、审美判断力、主动性及网络安全(首个达Critical等级)等方面全面升级,Greg Brockman在媒体闭门会上宣布"欢迎来到AGI时代"。
强化学习与可验证奖励(RLVR)已成为提升视觉语言模型(VLM)推理能力的标配手段。但一个隐蔽的问题始终存在:最终答案的奖励信号,只告诉模型「答对了没有」,却从不告诉它「答案应该从图像的哪个区域得出」。答对,可能是因为真的看懂了图,也可能只是语言先验的捷径、数据集的偏差,甚至是一次幸运的瞎猜。
李飞飞旗下World Labs发布世界模型Atlas的同一天,Qing Yin创办的Visko推出世界模型Orbis并完成1000万美元Pre-seed融资,主打画面可持续运行并接受实时指令的Live Model。
「全球首个」多模态世界模型,来了!