AI资讯新闻榜单内容搜索-LLM

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: LLM
揭开多智能体决策的隐形不公,结果指标相同也未必可靠 | EMNLP'26

揭开多智能体决策的隐形不公,结果指标相同也未必可靠 | EMNLP'26

揭开多智能体决策的隐形不公,结果指标相同也未必可靠 | EMNLP'26

当多个大语言模型(LLM)组成「招聘委员会」,共同筛选简历、讨论候选人、打分并投票时,我们通常会用最终录用率来判断系统是否公平。

来自主题: AI技术研报
8278 点击    2026-09-09 14:51
全网最硬核 OpenClaw 2.0 实测:从 ToC 到 ToB 的试探,Agent 网关能重塑工作流边界吗?

全网最硬核 OpenClaw 2.0 实测:从 ToC 到 ToB 的试探,Agent 网关能重塑工作流边界吗?

全网最硬核 OpenClaw 2.0 实测:从 ToC 到 ToB 的试探,Agent 网关能重塑工作流边界吗?

OpenClaw 2.0(v2026.8.1)对比前代v2026.7.1-2的实测显示,新版将LLM请求次数减少38%、工具调用减少35%且未触发上下文压缩,把开源Agent从个人工具推向可长期托管、可协作复盘的工作系统,但命令行安装和工程门槛依然较高,更适合团队受控环境测试。

来自主题: AI产品测评
9506 点击    2026-09-05 11:08
T-RO综述重构Foundation Model时代机器人操作知识版图

T-RO综述重构Foundation Model时代机器人操作知识版图

T-RO综述重构Foundation Model时代机器人操作知识版图

过去几年,机器人操作领域几乎被一批新概念重新 “刷屏”。 LLM Planner、VLA、Diffusion Policy、Flow Matching、Latent Action、World Mode

来自主题: AI技术研报
8201 点击    2026-09-04 15:48
「自验证」框架让开源模型反超 Fable 5,冲上 GitHub 热榜

「自验证」框架让开源模型反超 Fable 5,冲上 GitHub 热榜

「自验证」框架让开源模型反超 Fable 5,冲上 GitHub 热榜

随着开源模型能力不断提升,它们已经能够以极低的成本生成多个高质量候选方案,并进一步利用模型自身对这些结果进行验证、打分和筛选。斯坦福团队最新实验发现,使用 DeepSeek V4 Flash + LLM-as-a-Verifier 进行「自验证」,可以在 Terminal-Bench 2.1 上超越 Claude Fable 5,同时整体成本低约 11 倍。

来自主题: AI技术研报
6383 点击    2026-08-28 12:01
斯坦福实验实锤: 魔改后的DS V4 Flash干翻Fable 5

斯坦福实验实锤: 魔改后的DS V4 Flash干翻Fable 5

斯坦福实验实锤: 魔改后的DS V4 Flash干翻Fable 5

同样的模型,同样的任务,让它执行五遍,再让他自己挑一遍最稳的,效果能有多大提升?斯坦福把这套玩法用在了AI身上,DeepSeek V4 Flash在Terminal-Bench 2.1的成绩从79%一路涨到88%,反超了尖子生Fable 5。而且连做五遍加挑选这一通折腾,价格依然比Fable 5便宜了4-11倍。

来自主题: AI技术研报
9677 点击    2026-08-25 10:41
挑战 1 比特!ETH Zürich 秦浩桐:如何把大模型「塞进」小设备?| IJCAI 2026

挑战 1 比特!ETH Zürich 秦浩桐:如何把大模型「塞进」小设备?| IJCAI 2026

挑战 1 比特!ETH Zürich 秦浩桐:如何把大模型「塞进」小设备?| IJCAI 2026

面对大模型规模与硬件内存之间高达20倍的算力鸿沟,不重训的“1比特量化”如何把千亿参数的硅基大脑塞进微型设备?

来自主题: AI资讯
8792 点击    2026-08-18 15:09
独家|腾讯混元徐灿转岗微信WeLM,微信AI进入加速阶段

独家|腾讯混元徐灿转岗微信WeLM,微信AI进入加速阶段

独家|腾讯混元徐灿转岗微信WeLM,微信AI进入加速阶段

《智能涌现》从相关人士处获悉,混元资深研究员徐灿在近期加入腾讯WeLM团队,从事大模型研发相关工作。多名知情人士透露,在姚顺雨接手腾讯大语言模型研发前,徐灿在混元LLM体系中担任后训练一个方向上的负责人。值得一提的是,这次转岗发生在微信持续强化自研大模型和Agent能力的阶段。

来自主题: AI资讯
8511 点击    2026-08-14 22:44
原生 AI TechBio 公司寻明生科( Aureka )完成了 1 亿美元 B 系列融资

原生 AI TechBio 公司寻明生科( Aureka )完成了 1 亿美元 B 系列融资

原生 AI TechBio 公司寻明生科( Aureka )完成了 1 亿美元 B 系列融资

原生 AI TechBio 公司寻明生科( Aureka )完成了 1 亿美元 B 系列融资。距离上一轮 A+ 轮融资,仅仅过去 4 个月。我们在用非常 LLM 的方式在做这个事情。寻明生科创始人兼 CEO 赵伟安博士打了比方,如果传统药物发现是在造油车,我们希望用特斯拉的方式把它重做一遍。

来自主题: AI资讯
9774 点击    2026-08-11 17:52
最高节省 85% 成本:微软公布 AI 智能体 LLM 路由方案

最高节省 85% 成本:微软公布 AI 智能体 LLM 路由方案

最高节省 85% 成本:微软公布 AI 智能体 LLM 路由方案

Microsoft 发布了 一个用于在 Azure Kubernetes 服务 上路由智能体流量的参考架构。它将这个问题分解为三个关键选择:由哪个模型响应调用、如何管理调用,以及由哪个 GPU 副本处理调用。

来自主题: AI资讯
6585 点击    2026-08-10 14:43
让生成式模型「画」出空间智能,而非强迫LLM输出「坐标」! 浙大提出Agentic空间认知评估框架

让生成式模型「画」出空间智能,而非强迫LLM输出「坐标」! 浙大提出Agentic空间认知评估框架

让生成式模型「画」出空间智能,而非强迫LLM输出「坐标」! 浙大提出Agentic空间认知评估框架

近日,浙江大学 OmniAI 团队在 《Show, Don’t Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text》 中提出 ProVisE,让图像生成模型直接在图中回答空间问题,并将视觉答案还原为原 benchmark 可以评分的结构化预测。

来自主题: AI技术研报
8853 点击    2026-08-08 13:34