AI资讯新闻榜单内容搜索-ARC-AGI-3

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: ARC-AGI-3
1位菲尔兹奖得主+12位博士,这些俄罗斯数学家训出了顶级AI

1位菲尔兹奖得主+12位博士,这些俄罗斯数学家训出了顶级AI

1位菲尔兹奖得主+12位博士,这些俄罗斯数学家训出了顶级AI

俄罗斯AI初创公司Mostik由12位博士和1位菲尔兹奖得主组成,在Kaggle ARC-AGI-3竞赛中冲上榜首,并推出让大模型与小模型在数学空间直接传递隐藏状态的"桥梁"技术,使混合系统运行成本仅为完整大模型的二十分之一且小模型补上约50%的性能差距。

来自主题: AI资讯
8211 点击    2026-09-07 16:49
突发,OpenAI GPT-6跑分作弊被抓包了!

突发,OpenAI GPT-6跑分作弊被抓包了!

突发,OpenAI GPT-6跑分作弊被抓包了!

媒体报道OpenAI发布GPT-6 Astra官博前后多次悄悄修改跑分数据,包括将自身幻觉率从4.2%降至2.0%、将竞品Anthropic Fable 5.1数学成绩调低近10个百分点,并将ARC-AGI-3得分从98.6%注水至99.99%,OpenAI仅以"消除噪点的常态修正"作为回应。

来自主题: AI资讯
8284 点击    2026-09-06 11:07
GPT-6 Astra全面解析 - “欢迎来到AGI时代。”

GPT-6 Astra全面解析 - “欢迎来到AGI时代。”

GPT-6 Astra全面解析 - “欢迎来到AGI时代。”

OpenAI正式发布GPT-6 Astra,宣称其为"全球最智能且最对齐的模型",在电脑操作(OSWorld完成率72.6%)、ARC-AGI-3(99.9分)、审美判断力、主动性及网络安全(首个达Critical等级)等方面全面升级,Greg Brockman在媒体闭门会上宣布"欢迎来到AGI时代"。

来自主题: AI资讯
9229 点击    2026-09-04 10:06
开源Agent框架刷爆ARC-AGI-3,「自我改进」的RLM harness引争议

开源Agent框架刷爆ARC-AGI-3,「自我改进」的RLM harness引争议

开源Agent框架刷爆ARC-AGI-3,「自我改进」的RLM harness引争议

这个框架名叫 Prime Agent,由 Prime Intellect 发布。官方对它的定义是:一个面向编程、研究和长时间自主任务的「自我改进 RLM harness」。RLM 是 MIT 博士生 Alex Zhang 等人去年 10 月发布的一项工作(参见《递归语言模型登场!MIT华人新作爆火,扩展模型上下文便宜又简单》)

来自主题: AI技术研报
9702 点击    2026-08-08 13:17
ARC-AGI-3近被完美攻破,这个Harness能让AI掌握物理学家思维

ARC-AGI-3近被完美攻破,这个Harness能让AI掌握物理学家思维

ARC-AGI-3近被完美攻破,这个Harness能让AI掌握物理学家思维

7 月 16 日,伯克利博士后 Haven Feng 的一条推文火了。原因无他,结果很震撼:在 ARC-AGI-3 Public 集上,一套名为 [schema] 的智能体框架,与 Claude Opus 4.8、Fable 5 组合后达到 98.98% 的 RHAE;换成 GPT-5.6 Sol 组合,分数也有 95.35%。

来自主题: AI技术研报
10200 点击    2026-07-18 14:22
这套题,GPT-5.5、Opus 4.7加起来没考到「1分」,人类却拿了满分100?

这套题,GPT-5.5、Opus 4.7加起来没考到「1分」,人类却拿了满分100?

这套题,GPT-5.5、Opus 4.7加起来没考到「1分」,人类却拿了满分100?

近日,ARC Prize 官方发布了针对这两款顶级模型的详细分析报告,结果令人震惊:在面对未见过的逻辑任务时,两者的表现得分均低于 1%,GPT-5.5 得分 0.43%,Claude Opus 4.7 得分 0.18%。

来自主题: AI技术研报
9716 点击    2026-05-02 15:00
刚刚,全球最难考试惊天大反转!AI黑马 Symbolica冲破36%,顶流模型集体翻车

刚刚,全球最难考试惊天大反转!AI黑马 Symbolica冲破36%,顶流模型集体翻车

刚刚,全球最难考试惊天大反转!AI黑马 Symbolica冲破36%,顶流模型集体翻车

就在昨天,ARC-AGI-3刚把全球顶尖大模型按在地上摩擦,结果一家名不见经传的公司却给出惊天消息:他们的AI在首日就取得了36.08%的成绩!这匹黑马究竟靠什么撕开全球最难AI考试的铁幕?是真突破,还是另有玄机?

来自主题: AI资讯
9859 点击    2026-03-27 15:24
全球顶尖大模型一夜惨遭血洗!最难AI测试人类拿满分,AI第一名得0.2%分

全球顶尖大模型一夜惨遭血洗!最难AI测试人类拿满分,AI第一名得0.2%分

全球顶尖大模型一夜惨遭血洗!最难AI测试人类拿满分,AI第一名得0.2%分

今夜,整个AI圈震动了。全球最难AGI测试ARC-AGI-3一上线,就把全球顶尖AI打到集体失声,人类满分通关,最强模型Opus 4.6得分仅0.2%,还不到1%。AI这是一夜被打回「原始人」了。

来自主题: AI资讯
8816 点击    2026-03-27 00:39