谷歌让AI互怼几天!小模型竟复现3道博士级难题
谷歌让AI互怼几天!小模型竟复现3道博士级难题谷歌Antigravity团队公布Teamwork多智能体编排框架成果,轻量级Gemini 3.7 Flash复现了Gemini 3.1 Pro解出的3道博士级数学难题,并从零构建RISC-V CPU模拟器、改进Eigen和ParlayHash开源库代码,证明小模型通过制度化博弈编排也能完成顶尖科研与工程任务。
搜索
谷歌Antigravity团队公布Teamwork多智能体编排框架成果,轻量级Gemini 3.7 Flash复现了Gemini 3.1 Pro解出的3道博士级数学难题,并从零构建RISC-V CPU模拟器、改进Eigen和ParlayHash开源库代码,证明小模型通过制度化博弈编排也能完成顶尖科研与工程任务。
腾讯WorkBuddy、阿里QwenWork等中国大厂AI办公产品出海面临获客成本高企、难以撼动Claude Code和Codex等海外成熟工具用户心智、品牌信任与数据合规门槛较高以及本地化不足等现实阻力,尽管中国AI模型凭借性价比在海外广受欢迎,国产AI办公Agent却尚未打开海外市场。
北京航空航天大学史振威与邹征夏教授团队开发了面向广域地球观测的生成式基础模型MetaEarth3D,只需给定文字或卫星图即可生成无界连续一致的三维世界场景,并自带空间标注使空天AI模型空间理解能力平均提升22.85%。
浙大与港大团队开源轻量化记忆路由器LayerRecall,通过选择性检索历史记忆并仅注入对长程信息敏感的特定DiT层,解决长视频生成中角色离场再返回时身份与属性丢失的问题,在MemoBench和MovieBench评测中取得Overall第一,且约6.6MB的路由权重可零再训练迁移至其他视频生成骨干。
在Epoch AI与曼彻斯特大学发布的FrontierMath Erdős基准测试中,GPT-6 Astra以3%得分率成为唯一非零分模型并解开5道Erdős难题,而GPT-5.6 Sol、GPT-5.5、Fable 5.1与Claude Fable 5均交白卷。
Anthropic发布Fable 5.1,推出"上下文一致性验证"机制,严格锁定API返回的"思考块",任何修改上下文的行为将被直接报错,从而彻底切断通过API蒸馏大模型推理过程的后路。
实测首个AGI级别模型GPT-6,用一张白宫照片在22分钟内生成可自由漫游和调光的三维场景,并完成秦始皇骑北极熊的SVG动画、一句话制作马里奥风格赛车游戏及模仿孙宇晨风格的短文写作,展现其根据简短需求主动补全细节的能力。
鼎犀智创(Rhinovate™)近日完成数亿元Pre-A轮融资,由鼎晖百孚领投,资金将重点用于RhinoMat材料科学基础大模型及多场景可编排AI智能体与自主进化实验室体系建设,并推进碳基高性能材料放大验证。
小米凭借覆盖芯片(玄戒O3/O100/D100)、大模型(MiMo-V2.5、Xiaomi-Robotics系列)、澎湃OS 4、11.6亿台IoT设备及三大智能工厂的完整链路,成为全球首个实现"人车家全生态"物理AI落地的科技公司,在IFA 2025上展示了从数字世界走向物理世界的生态整合优势。
微软开始倒查员工AI账单,有员工28天内烧掉2.8万美元(约19万元人民币)token,公司因此推行部门预算、个人支出仪表盘等管控措施,并将默认模型切换为OpenAI的GPT-5.6 Sol。