浙大开源PhyEdit:单图编辑+精准3D物体操作 | ACM MM'26
浙大开源PhyEdit:单图编辑+精准3D物体操作 | ACM MM'26图像生成模型正从「会创作」转向「可操作」。
搜索
图像生成模型正从「会创作」转向「可操作」。
从物理视频生成到运动迁移,再到可控世界建模。
端到端策略模型在物理世界频频失灵,研究者转向 “大模型智能体 + 工具调用” 自救,试图在动态物理世界中持续学习。然而,这条在线学习路径在物理世界仍未真正走通。
给AI一句“生成一款坦克大战游戏”,代码很快跑了起来。
机器人走出实验室后,训练数据不再只是 “多不多” 的问题:环境能否覆盖真实世界的尺度、遮挡、接触和运动,直接决定策略能否落地。Real2Sim 因此重新受到关注 —— 如果普通视频也能变成可交互的仿真场景,采集成本会比人工建模或专用设备低得多。
过去几年,大模型推理系统优化的核心目标一直围绕一个问题展开:如何让 GPU 更高效地计算权重、激活、KV Cache 等高维张量?从并行策略、请求调度、显存管理到算子优化,学界业界大量优化技术不断提升模型推理效率。
当机器人把书放进抽屉,它看到的是一串二维图像,然而真正需要完成的,却是一段发生在三维空间、持续随时间演化的动作。
AI的“情绪”也会影响工作状态?
请想象这样一种居家场景:当你戴着 AI 眼镜在厨房准备晚饭,用刀切菜时,它会立刻提醒你注意安全;当你连续几天形成举着手机长时间录像的习惯时,它会主动建议你换一种更省力的记录方式。
据路透社 8 月 14 日独家报道,苹果已经针对中国市场训练了一款大型语言模型。三名知情人士透露,这款模型由苹果与阿里巴巴共同开发,阿里还为模型训练提供了支持。苹果和阿里均未回应置评请求。 随着新 iPhone 已经进入发布倒计时,中国用户也不免再次关心起这个问题:国行 Apple Intelligence 到底能不能用?