给 Agent 做“CT”:大规模 Agent 的可观测与质量保障体系
给 Agent 做“CT”:大规模 Agent 的可观测与质量保障体系随着大语言模型能力边界的持续拓展,AI Agent 已从概念验证阶段迈入大规模工程落地。然而,Agent 内部复杂的任务规划、工具调用与记忆检索机制,使得传统的应用观测手段在面临这类非确定性系统时显得力不从心。
搜索
随着大语言模型能力边界的持续拓展,AI Agent 已从概念验证阶段迈入大规模工程落地。然而,Agent 内部复杂的任务规划、工具调用与记忆检索机制,使得传统的应用观测手段在面临这类非确定性系统时显得力不从心。
近期,字节跳动大模型核心部门Seed完成新一轮组织调整,调整核心集中在Seed Foundation Model(Seed基础模型)板块,新设四个一级部门,重构了预训练数据、强化学习与后训练的组织链路。
《读佳》获知,阿里旗下的虎鲸文娱集团已自研完成“虎鲸AI大模型”,并且正在内测一款全新的AI视频内容创作工具“虎鲸AI”,该工具部分功能需要充值才能使用,整个项目的研发测试或至少有半年以上。
当一个视频模型和 Seedance 2.5 同一天发布,似乎大概率要成炮灰,但 MiniMax H3 却成了一个例外。而现在 MiniMax 也开始把这种模型的能力,放到了具体的产品上,正式推出了 MiniMax Design,进一步把 H3 视频模型的能力放大,同时也让我们少折腾一些,可以更高效地制作各种商业化内容。
外挂补不了模型智商,《苦涩的教训》再次上演。
2026世界机器人大会(WRC)开幕当天,北京亦庄的展馆里挤满了人形机器人、工业机械臂和各式各样的灵巧手Demo。
在 action chunking 已成为 VLA 标配的今天,「一次执行多少步」几乎被所有工作当作一个固定的超参数。
长期依赖外部模型,不是最好的选择。
当自动驾驶赛车以近 300 km/h 的时速在 F1 赛道上与周车进攻防守、交互博弈,它面对的问题早已不只是提升圈速。
Pixel 擅长表达 appearance,Code 擅长表达 structure;未来会进入 Pixel-Code 联合的视觉表达。