揭秘AI幻觉:GPT-4V存在视觉编码漏洞,清华联合NUS提出LLaVA-UHD
揭秘AI幻觉:GPT-4V存在视觉编码漏洞,清华联合NUS提出LLaVA-UHDGPT-4V 的推出引爆了多模态大模型的研究。GPT-4V 在包括多模态问答、推理、交互在内的多个领域都展现了出色的能力,成为如今最领先的多模态大模型。
来自主题: AI技术研报
6480 点击 2024-04-07 17:46
搜索
GPT-4V 的推出引爆了多模态大模型的研究。GPT-4V 在包括多模态问答、推理、交互在内的多个领域都展现了出色的能力,成为如今最领先的多模态大模型。
扩散模型,迎来了一项重大新应用——像Sora生成视频一样,给神经网络生成参数,直接打入了AI的底层!
最近,来自NUS、斯坦福、谷歌DeepMind等机构的研究人员,尝试开发了一个评估人类和AI的创造力的框架。而当人类用尽所有手段来逼迫AI把创造力发挥到极限,发现GPT-4几乎对于所有事物认知的极限都是无尽的宇宙空间。
多模态大模型集成了检测分割模块后,抠图变得更简单了!
“AI 取代摄影”,或许真的在一步步靠近?这两日,一个名为 Magnific 的 AI 图像增强工具在外网似有冒头趋势。部分 AI 圈内的设计师第一时间得到了测试机会,并在 X 上分享了使用感受,其中不乏像 Linus Ekenstam 这样的 KOL 以及领英高级首席设计师 Armando Sotoca 这样的人物。