AI资讯新闻榜单内容搜索-多模态

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: 多模态
深度|大模型的空间直觉从哪里来,又为什么会失灵?MirroS在S-Space里找答案

深度|大模型的空间直觉从哪里来,又为什么会失灵?MirroS在S-Space里找答案

深度|大模型的空间直觉从哪里来,又为什么会失灵?MirroS在S-Space里找答案

多模态模型的空间推理,有一种很反直觉的现象:它能看懂图里有什么,也能回答简单的左右上下,却会在换视角、判断方位、推理前后关系时突然失灵。

来自主题: AI资讯
5902 点击    2026-09-09 15:22
GPT-6 Astra为何如此惊艳?S-Space透视多模态模型内部的空间智能

GPT-6 Astra为何如此惊艳?S-Space透视多模态模型内部的空间智能

GPT-6 Astra为何如此惊艳?S-Space透视多模态模型内部的空间智能

最近,GPT-6 Astra 的三维建模与空间理解 demo 引发关注。它能在 Blender 中搭建带家具和庭院的住宅,再将场景转入 Unreal Engine 5,让人能走进房间、打开柜门,甚至操作咖啡机。

来自主题: AI技术研报
8298 点击    2026-09-09 11:43
刚刚,DeepSeek 新模型突然上线,Flash 的模型,Pro 的野心

刚刚,DeepSeek 新模型突然上线,Flash 的模型,Pro 的野心

刚刚,DeepSeek 新模型突然上线,Flash 的模型,Pro 的野心

DeepSeek 突然上线限时内测模型 DeepSeek V4.1 Flash,采用新模型结构并原生支持多模态,在生成速度、使用成本和中文长文写作等实测中表现优于以往版本,DeepSeek 期望其在保持 Flash 速度与价格优势的同时,能力向 V4 Pro 靠拢。

来自主题: AI资讯
9856 点击    2026-09-08 18:06
图形学宗师童欣加盟Meshy,要做“AI for Fun”的头号玩家

图形学宗师童欣加盟Meshy,要做“AI for Fun”的头号玩家

图形学宗师童欣加盟Meshy,要做“AI for Fun”的头号玩家

图形学宗师童欣正式加盟胡渊鸣创办的AI 3D公司Meshy出任首席科学家,将负责制定长期科研战略,与胡渊鸣共同推进多模态世界模型与实时交互系统突破,朝着"AI for Fun"的愿景迈进。

来自主题: AI资讯
8079 点击    2026-09-07 16:50
独家|前DeepSeek核心研究员魏浩然出任百度文心多模态算法负责人

独家|前DeepSeek核心研究员魏浩然出任百度文心多模态算法负责人

独家|前DeepSeek核心研究员魏浩然出任百度文心多模态算法负责人

前DeepSeek核心研究员魏浩然近日带队加入百度基础模型研发部,出任文心大模型多模态算法负责人,负责端到端OCR等方向,其此前主导的Unlimited OCR模型曾在OmniDocBench评测中取得全球第一。

来自主题: AI资讯
9088 点击    2026-09-06 11:05
全球最大私人药企,部署了Owkin的AI科学家

全球最大私人药企,部署了Owkin的AI科学家

全球最大私人药企,部署了Owkin的AI科学家

AI制药公司Owkin与勃林格殷格翰达成许可协议,将人工智能科学家K Pro及多模态患者数据用于肿瘤学和免疫学多个适应症的药物发现,K Pro已将Owkin内部药物靶点识别速度提升70%。

来自主题: AI资讯
8167 点击    2026-09-05 10:50
对话已死,共生永生:颜水成团队发布 VoiceMem,为 AGI 找回「丢掉的昨天」

对话已死,共生永生:颜水成团队发布 VoiceMem,为 AGI 找回「丢掉的昨天」

对话已死,共生永生:颜水成团队发布 VoiceMem,为 AGI 找回「丢掉的昨天」

颜水成团队发布语音领域首个实时“流式双脑架构”记忆框架,左脑记信息,右脑记住你。 编辑丨岑峰 科幻电影曾无数次预演过AI与人类共生的场景。但在2026年的今天,尽管GPT-4o、全双工模型、Inter

来自主题: AI资讯
8526 点击    2026-09-04 10:45
答对了却没看图?EASE给多模态RLVR装上「视线校正器」

答对了却没看图?EASE给多模态RLVR装上「视线校正器」

答对了却没看图?EASE给多模态RLVR装上「视线校正器」

强化学习与可验证奖励(RLVR)已成为提升视觉语言模型(VLM)推理能力的标配手段。但一个隐蔽的问题始终存在:最终答案的奖励信号,只告诉模型「答对了没有」,却从不告诉它「答案应该从图像的哪个区域得出」。答对,可能是因为真的看懂了图,也可能只是语言先验的捷径、数据集的偏差,甚至是一次幸运的瞎猜。

来自主题: AI技术研报
6941 点击    2026-09-03 14:17
0.25秒识破未见攻击,这套检测方法没看过任何越狱样本 | EMNLP'26

0.25秒识破未见攻击,这套检测方法没看过任何越狱样本 | EMNLP'26

0.25秒识破未见攻击,这套检测方法没看过任何越狱样本 | EMNLP'26

大视觉语言模型(LVLM)把语言理解扩展到了图像等多模态输入,同时,也带来了更隐蔽的攻击面。

来自主题: AI技术研报
5698 点击    2026-09-03 09:50