BIMSA 王雅晴:Scaling Law 触及天花板,「数据高效学习」指向 AI 的下一站|IJCAI 2026
BIMSA 王雅晴:Scaling Law 触及天花板,「数据高效学习」指向 AI 的下一站|IJCAI 2026真正的智能,在于能否基于有限的数据,实现可靠的泛化与迁移。
搜索
真正的智能,在于能否基于有限的数据,实现可靠的泛化与迁移。
香港大学、香港科技大学与腾讯 ARC Lab 联合提出 SCoPE(Sightline-Coordinate Positional Encoding),一套面向视频 DiT 的射线空间位置编码:让视频模型处理位置关系的基底从张量网格转向射线空间。
训练一切AI的算法,被AI自己判了「死刑」?就在最近,清华大学和宾大沃顿商学院的两位研究者挂出一篇新论文,给了一个优化理论界等了40年的结论——梯度下降想跑到最快,光调步长没用。
JiuwenBox 的定位,可以用一个比喻说清:给 AI 干活的临时房间。它和 WorkSwarm 是这么配合的:用户在 WorkSwarm 里发一个任务,Agent 负责把任务想清楚、拆成几步;每一步要跑的命令、要运行的代码、要碰的文件,统统送进 JiuwenBox 的沙箱去执行。Agent 负责 "出主意",沙箱负责 "安全地动手"。
在 action chunking 已成为 VLA 标配的今天,「一次执行多少步」几乎被所有工作当作一个固定的超参数。
当自动驾驶赛车以近 300 km/h 的时速在 F1 赛道上与周车进攻防守、交互博弈,它面对的问题早已不只是提升圈速。
今天的视频生成模型,已经越来越像一个会拍电影的导演。
十多年前,Ilya Sutskever 说过这么一句话。 「模型就是想学习。」
大模型机制可解释性研究中,一直存在一个颇具反差的现实: 为了理解一个已经训练好的模型,研究者往往需要先训练一套新的稀疏表示。
视觉 - 语言 - 动作(VLA)模型已成为端到端自动驾驶的主流技术路线,但基于自回归(AR)解码的现有架构面临双重结构性瓶颈:其一,逐 Token 串行生成导致推理延迟随序列长度线性增长,严重制约实时部署;其二,训练阶段依赖真实前缀的 teacher forcing 机制,使模型在推理时暴露于自身生成的误差之上,引发长时序累积的曝光偏差(exposure bias)。