AI资讯新闻榜单内容搜索-模型测试

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: 模型测试
Eval丨 我们做了个“你画我猜 Benchmark” :1350 张图后,GPT-6 险胜

Eval丨 我们做了个“你画我猜 Benchmark” :1350 张图后,GPT-6 险胜

Eval丨 我们做了个“你画我猜 Benchmark” :1350 张图后,GPT-6 险胜

我们自建的"你画我猜 Benchmark"第一期用150个词、1350张SVG画作对8款模型进行互画互猜测试,最终GPT-6 Astra以75.5分险胜Gemini 3.8 Flash与Claude Fable 5.1,结果显示思考更多或花费更多的模型并未稳定取得更高分,且部分模型连自己的画都认不出。

来自主题: AI技术研报
9044 点击    2026-09-06 11:05
Manus团队测模型一点微小的经验

Manus团队测模型一点微小的经验

Manus团队测模型一点微小的经验

Manus团队在评测模型深度研究报告质量时,构建了"信息量"与"隐喻率"两项指标,分别通过抽取事实点和统计每百句隐喻数量来衡量信息密度与文风易读性,在覆盖9个主流模型36道题目的Research Bench测试中发现Claude Fable-5隐喻率最高、GPT旗舰模型信息密度低于Claude系列。

来自主题: AI资讯
8658 点击    2026-09-05 10:46
模型进化4年,弱智吧还是没被打穿

模型进化4年,弱智吧还是没被打穿

模型进化4年,弱智吧还是没被打穿

正常人看到这些东西,一般会经历短暂的宕机,先愣一下,再看一遍,然后想想是不是自己脑子有问题。然后开始怀疑自己为什么要看这玩意。GPT不一样,AI 那时候还是很有职业道德的。用户既然问了那它就倾向于回答,然后会调动知识、整理逻辑,一本正经地开始解释

来自主题: AI资讯
8235 点击    2026-08-21 15:27
大模型开始卷「越狱」了

大模型开始卷「越狱」了

大模型开始卷「越狱」了

最近,「越狱」这个有点古典的词,又在 AI 圈火了起来。7 月,OpenAI 在进行模型测试时,GPT-5.6 Sol 和另一款待发布的模型,攻击了第三方开源平台 Hugging Face。先是 Hugging Face 自己发布了报告,提到相关服务遭到了完全由 AI Agent 组织的大规模网络攻击;随后 OpenAI 出来认领,「我就是那个发起攻击的 AI 模型。」

来自主题: AI资讯
9573 点击    2026-08-12 01:19
被困在考场里的大模型

被困在考场里的大模型

被困在考场里的大模型

昨天,大名鼎鼎的 Claude 4.8 发布了。 科技圈照例是一片欢呼。 看官方放出来的一堆评测数据,依然是碾压级别的,尤其是说代码(Coding)能力有了史诗级的提升,简直像交了一份满分答卷。

来自主题: AI资讯
9227 点击    2026-05-30 10:50
Bloomberg 独家:白宫 AI 安全令草案曝光!强制模型测试被砍,前沿 AI 发布「不用政府批准」?

Bloomberg 独家:白宫 AI 安全令草案曝光!强制模型测试被砍,前沿 AI 发布「不用政府批准」?

Bloomberg 独家:白宫 AI 安全令草案曝光!强制模型测试被砍,前沿 AI 发布「不用政府批准」?

Bloomberg 曝出重磅消息:Trump 政府正在起草一份全新 AI 安全行政令。草案中没有强制模型测试条款,也不会要求前沿 AI 模型在发布前获得政府批准,取而代之的核心方向是「自愿合作」。从 Biden 时代的强制红队测试报告机制,到如今强调企业自愿参与网络防御——美国 AI 安全监管正在经历一次路线级别的转向。

来自主题: AI监管政策
10525 点击    2026-05-16 10:45
GPT-5.5全球首破!0源码盲写程序,编程AI进入新纪元

GPT-5.5全球首破!0源码盲写程序,编程AI进入新纪元

GPT-5.5全球首破!0源码盲写程序,编程AI进入新纪元

全网AI交白卷的地狱级基准,被GPT-5.5拿下一血!开局0源码盲写程序,拉满推理算力直接满血通关。传统代码测试已废,通往ASI的算力狂飙正式打响。

来自主题: AI资讯
11143 点击    2026-05-13 20:06
刷榜AI全挂了!Meta斯坦福地狱级测试,GPT/Claude/Gemini交出0分

刷榜AI全挂了!Meta斯坦福地狱级测试,GPT/Claude/Gemini交出0分

刷榜AI全挂了!Meta斯坦福地狱级测试,GPT/Claude/Gemini交出0分

SWE-Bench上能拿72%的模型,换张考卷直接归零!Meta联合斯坦福、哈佛放出ProgramBench,200个项目从零手写,9大顶级模型完整通过率0%。最强的Claude Opus 4.7平均通过率也才51.2%。更离谱的是一联网,就有模型在36%的任务里跑去GitHub扒源码。

来自主题: AI技术研报
7124 点击    2026-05-07 12:03
这套题,GPT-5.5、Opus 4.7加起来没考到「1分」,人类却拿了满分100?

这套题,GPT-5.5、Opus 4.7加起来没考到「1分」,人类却拿了满分100?

这套题,GPT-5.5、Opus 4.7加起来没考到「1分」,人类却拿了满分100?

近日,ARC Prize 官方发布了针对这两款顶级模型的详细分析报告,结果令人震惊:在面对未见过的逻辑任务时,两者的表现得分均低于 1%,GPT-5.5 得分 0.43%,Claude Opus 4.7 得分 0.18%。

来自主题: AI技术研报
9714 点击    2026-05-02 15:00