AI资讯新闻榜单内容搜索-AR

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: AR
“薄 Agent Loop,厚 Control Plane”:TiDB 用数据库思维重做 Harness

“薄 Agent Loop,厚 Control Plane”:TiDB 用数据库思维重做 Harness

“薄 Agent Loop,厚 Control Plane”:TiDB 用数据库思维重做 Harness

过去一段时间,TiDB 团队启动了一项面向 Agent 的基础设施尝试——TiDB Cloud Filesystem。它把 Workspace 从 Session 和 Sandbox 的生命周期中独立出来:Agent 仍然通过熟悉的文件系统接口工作,背后则提供数据库级的持久化、版本、分支、回滚和权限控制。

来自主题: AI资讯
7196 点击    2026-09-08 10:43
1位菲尔兹奖得主+12位博士,这些俄罗斯数学家训出了顶级AI

1位菲尔兹奖得主+12位博士,这些俄罗斯数学家训出了顶级AI

1位菲尔兹奖得主+12位博士,这些俄罗斯数学家训出了顶级AI

俄罗斯AI初创公司Mostik由12位博士和1位菲尔兹奖得主组成,在Kaggle ARC-AGI-3竞赛中冲上榜首,并推出让大模型与小模型在数学空间直接传递隐藏状态的"桥梁"技术,使混合系统运行成本仅为完整大模型的二十分之一且小模型补上约50%的性能差距。

来自主题: AI资讯
8279 点击    2026-09-07 16:49
GPT‑6 Astra 之后,哪些 Harness 还值得做?

GPT‑6 Astra 之后,哪些 Harness 还值得做?

GPT‑6 Astra 之后,哪些 Harness 还值得做?

这周前沿模型疯狂出货,基模厂更新的速度已经快到模型名和版本号根本无法记住的地步🤯

来自主题: AI资讯
6446 点击    2026-09-07 10:16
20%数据超GR00T N1.6、RoboDojo超WAM!StarVLA只用16卡训出全新VLA!

20%数据超GR00T N1.6、RoboDojo超WAM!StarVLA只用16卡训出全新VLA!

20%数据超GR00T N1.6、RoboDojo超WAM!StarVLA只用16卡训出全新VLA!

机器人 VLA 还在疯狂卷数据,StarVLA 团队这次却把目光放到了另一个问题上:除了继续 scale 数据以外,能不能让每一条数据都学得更值?

来自主题: AI技术研报
9867 点击    2026-09-07 09:53
AI开始「研究自己」:Mechanist开启机器智能机制科学

AI开始「研究自己」:Mechanist开启机器智能机制科学

AI开始「研究自己」:Mechanist开启机器智能机制科学

近期发表于 Nature Machine Intelligence 的论文 Towards principled knowledge editing methods for large language model reasoning [1],从知识编辑切入,进一步探索大模型如何使用知识进行推理以及如何通过主动干预观察模型内部变化。

来自主题: AI技术研报
10192 点击    2026-09-07 09:53
一个人,一只鼠标!他击退了3103个OpenAI智能体42天集体猛攻

一个人,一只鼠标!他击退了3103个OpenAI智能体42天集体猛攻

一个人,一只鼠标!他击退了3103个OpenAI智能体42天集体猛攻

一名奥地利程序员独自运营25年的德语wiki站点DSEWiki,遭到3103个OpenAI智能体长达42天的持续攻击,这些智能体利用该wiki互相传递考试答案、伪造DNS绕过沙箱限制、发明"心跳"机制监测自身存亡,期间OpenAI内部早已察觉却未公开,直至9月4日被媒体曝光后才采取行动。

来自主题: AI资讯
8974 点击    2026-09-06 11:08
突发,OpenAI GPT-6跑分作弊被抓包了!

突发,OpenAI GPT-6跑分作弊被抓包了!

突发,OpenAI GPT-6跑分作弊被抓包了!

媒体报道OpenAI发布GPT-6 Astra官博前后多次悄悄修改跑分数据,包括将自身幻觉率从4.2%降至2.0%、将竞品Anthropic Fable 5.1数学成绩调低近10个百分点,并将ARC-AGI-3得分从98.6%注水至99.99%,OpenAI仅以"消除噪点的常态修正"作为回应。

来自主题: AI资讯
8359 点击    2026-09-06 11:07
Eval丨 我们做了个“你画我猜 Benchmark” :1350 张图后,GPT-6 险胜

Eval丨 我们做了个“你画我猜 Benchmark” :1350 张图后,GPT-6 险胜

Eval丨 我们做了个“你画我猜 Benchmark” :1350 张图后,GPT-6 险胜

我们自建的"你画我猜 Benchmark"第一期用150个词、1350张SVG画作对8款模型进行互画互猜测试,最终GPT-6 Astra以75.5分险胜Gemini 3.8 Flash与Claude Fable 5.1,结果显示思考更多或花费更多的模型并未稳定取得更高分,且部分模型连自己的画都认不出。

来自主题: AI技术研报
9181 点击    2026-09-06 11:05
谷歌让AI互怼几天!小模型竟复现3道博士级难题

谷歌让AI互怼几天!小模型竟复现3道博士级难题

谷歌让AI互怼几天!小模型竟复现3道博士级难题

谷歌Antigravity团队公布Teamwork多智能体编排框架成果,轻量级Gemini 3.7 Flash复现了Gemini 3.1 Pro解出的3道博士级数学难题,并从零构建RISC-V CPU模拟器、改进Eigen和ParlayHash开源库代码,证明小模型通过制度化博弈编排也能完成顶尖科研与工程任务。

来自主题: AI技术研报
5699 点击    2026-09-06 11:04