7B打败o3、GPT-5!医学AI智能体让模型学会“看哪里、怎么看”
7B打败o3、GPT-5!医学AI智能体让模型学会“看哪里、怎么看”医学AI会写解释,但不代表它真的“看到”了关键证据。
搜索
医学AI会写解释,但不代表它真的“看到”了关键证据。
超越 GPT-5.5、Gemini 3.5 Flash、DeepSeek V4 Pro,阿里的最新旗舰模型 Qwen3.7 Max 在编程竞技榜拿下第二名,仅次于 Claude Opus 4.7。除了真实场景的用户选择,在传统的大模型固定评测榜单上,像是终端能力 Terminal Bench、编程能力 SWE Bench 等,Qwen3.7 Max 的表现也是拿下了国产模型的冠军。
Gemini 3.5的闯祸实录。
一个号称「零污染」的新基准 DeepSWE,用113道原创题撕开了旧编程榜单的遮羞布。
3D世界“会看”了,但还不会“改”。
就在几天前(5月22日),DeepSeek官方扔出了一枚重磅炸弹:DeepSeek-V4-Pro将在5月底结束优惠后,永久降价至原价的四分之一。各大媒体瞬间被诸如“白菜价”、“夯爆了”的标题刷屏。看看这组惊人的新定价:每百万Token输出6元,输入(缓存未命中)3元,而输入(缓存命中)仅仅只要0.025元!
距离谷歌的Gemini 3.5 Flash发布已经一周多了。
据彭博社援引知情人士透露,字节跳动计划采购数百万颗高通AI ASIC芯片,用于支持其AI Agent业务。受相关消息刺激,高通股价周三盘中一度上涨8.3%,创下阶段性新高。
昨晚,AI模型聚合平台OpenRouter宣布完成1.13亿美元(约合人民币7.67亿元)的B轮融资。本轮融资由谷歌母公司Alphabet旗下的成长基金CapitalG领投,英伟达NVentures、ServiceNow等一众风险投资机构跟投,a16z、Menlo Ventures持续加注。外媒报道,该公司融资过后估值飙升至13亿美元(约合人民币88.22亿元)。
就在今天,教皇的首份AI通谕震撼发布,42300字宣言《壮丽人性》引人深思!Anthropic联创也绝望向教皇求助:大模型已经演化出恐惧与悲伤,人类实验室已经无法自我修正。