一兆瓦养活6万智能体!英伟达GB300碾压前代20倍
一兆瓦养活6万智能体!英伟达GB300碾压前代20倍同样一兆瓦电,英伟达最新的GB300 NVL72能同时扛住61400个智能体,上一代H200只扛得住大约2600个。这中间,差了整整20倍。它就是独立评测机构Artificial Analysis发布的新基准:AA-AgentPerf。
搜索
同样一兆瓦电,英伟达最新的GB300 NVL72能同时扛住61400个智能体,上一代H200只扛得住大约2600个。这中间,差了整整20倍。它就是独立评测机构Artificial Analysis发布的新基准:AA-AgentPerf。
5周内,他们如何做出了一个新的Agent产品,并完成了组织改造?那时,他们的公司火星电波成立了1年2个月,刚刚拿到新一笔200万美元融资。ListenHub——他们打造的一款AI驱动的音频内容生成工具,已经做到300万美元ARR,并实现了月度盈亏平衡。且,ListenHub仍在增长。按照原来的计划,他们会继续把它推向海外,到年底,营收或许还能再翻几倍。
近日,上海AI Lab等团队提出了一种面向专业软件智能体的新范式——ComAct(COM-as-Action)。它的核心思想在于:不再把鼠标点击和键盘输入作为Agent的action,而是让Agent直接生成COM代码,通过软件底层对象模型操纵真实专业软件。
vLLM 社区推出的 Semantic Router 除了专注上面三个方向,正在更进一步:我们认为:router 不只是选择模型,还可以提升模型能力。用户不用改权重,也不用让每个 Agent 团队都自己搭一套 Graph,而是在一次普通 Model API 调用的内部,组织出一支有边界、有预算、有验证、有回退的 “小队”。
AI新云赛道再现巨额融资。成立于2022年的AI新云(Neocloud)公司Together AI,于7月1日正式宣布完成8亿美元C轮融资,投后估值达到83亿美元。Together AI的核心业务是出租NVIDIA GPU集群及其他AI专用基础设施,为企业提供运行开源大模型的云平台。
Github热榜持续屠榜,短短几天一路狂揽15.4k stars,甚至一度冲到了Top 1的位置。不是啥大厂项目,也不是啥新模型。而是一个叫OpenMontage的开源「视频制作」系统~(剪辑人狂喜.jpg)
中国人民大学的研究团队提出 CoDA-Bench,联合评估 Agent 的 Code Intelligence + Data Intelligence。该基准首次把 Code Agent 放进包含 1000 + 数据文件的复杂环境下,要求模型先自主探索文件系统、找到相关数据,再编写代码完成分析。实验显示,即使当前表现最好的系统,在 CoDA-Bench 上执行准确率也只有 61.1%;
三星大模型团队联合北京大学、香港城市大学、香港科技大学等科研机构,共同发布了面向 AI Agent 的基准测试 LiveClawBench。它关注的并不是「谁的 Agent 更强」,而是一个更基础、也更关键的问题:为什么同一个 AI Agent,在一些任务中已经接近可用,而在另一些任务中却会突然失稳?
DSpark刚开源一周,就被搬进了苹果电脑。移植版本叫mlx-dspark,跑的是Gemma-4 12B和Qwen3-4B这两个模型。装上之后,这两个模型在Mac上的生成速度分别提了1.6倍和1.4倍。
今晚,我在旧金山 Howard Street 的 Inngest 总部,参加了一场叫做 {AI} in Production 的小型聚会。主办方是 Inngest,Cursor、Arcade、Vapi 联合参与。清一色是在一线真正跑 AI agent 的工程师和创始人,一群人坐在一起,讲他们把 AI 部署进生产环境之后遇到的真实问题。