ECCV 2026 | AgentVLN:让机器人导航进入Agent时代
ECCV 2026 | AgentVLN:让机器人导航进入Agent时代近年来,视觉语言模型(Vision-Language Model, VLM)在图像理解、语义推理等任务中展现出了强大的能力。然而,当这些模型真正进入物理世界,让机器人根据一句自然语言指令完成自主导航时,仍然面临巨大挑战。
搜索
近年来,视觉语言模型(Vision-Language Model, VLM)在图像理解、语义推理等任务中展现出了强大的能力。然而,当这些模型真正进入物理世界,让机器人根据一句自然语言指令完成自主导航时,仍然面临巨大挑战。
If I Had One Bet on Robot Learning, I’d Bet on Cross-Entropy. 大语言模型的成功揭示了一个适用于一维序列数据的清晰 Scaling Law:通过自回归训练,并采用交叉熵(cross-entropy)目标函数预测下一个 token 的概率分布,模型能够建模非常复杂的语义概率分布,并随着数据规模和模型规模的增长持续提升性能。
刚刚,OpenAI 发文投下一颗重磅新闻,称他们使用一种比 GPT-6 Astra 更强大的、未公开的下一代前沿大模型,联合约 10000 个并发协作的 AI Agent,仅耗时 88 个小时,便攻克了克雷数学研究所设立的七大千禧年难题之一 —— 纳维 - 斯托克斯方程(Navier-Stokes Equation)的存在性与光滑性问题。
该公司曾做出“全球首个AI软件工程师”。
手搓AI开放世界的北大哲学博士,刚刚又杀回来了!
由Teambition创始人齐俊元重启12年前项目打造的Today AI正式开启公测,这款Personal AI通过连接软件与设备构建多层Memory体系,在任务暂停后能主动判断并推进下一步,被认为是当下最主动的Personal AI。
长文、网页、视频和代码经常停在这样的「半成品」状态:海报文案没有写错,却挤出了页面;网站首屏很漂亮,按钮点下去毫无反应;视频里的镜头单看都成立,连起来却丢了人物和节奏;程序刚修好一个模块,另一处又出现回归。
让 Agent 完成一个任务并不难。它会整理材料、修改文件、检查结果,再交付答案。
真正的壁垒,藏在没法开源的部署Know-how里。
物理AI感知公司Lyte完成1.65亿美元C轮融资,投后估值达16亿美元,由Maverick Silicon领投,该公司由前苹果Face ID工程师创立,核心产品LyteVision™为机器人提供全栈自研感知基础设施。