谷歌让AI互怼几天!小模型竟复现3道博士级难题
谷歌让AI互怼几天!小模型竟复现3道博士级难题谷歌Antigravity团队公布Teamwork多智能体编排框架成果,轻量级Gemini 3.7 Flash复现了Gemini 3.1 Pro解出的3道博士级数学难题,并从零构建RISC-V CPU模拟器、改进Eigen和ParlayHash开源库代码,证明小模型通过制度化博弈编排也能完成顶尖科研与工程任务。
搜索
谷歌Antigravity团队公布Teamwork多智能体编排框架成果,轻量级Gemini 3.7 Flash复现了Gemini 3.1 Pro解出的3道博士级数学难题,并从零构建RISC-V CPU模拟器、改进Eigen和ParlayHash开源库代码,证明小模型通过制度化博弈编排也能完成顶尖科研与工程任务。
OpenClaw 2.0(v2026.8.1)对比前代v2026.7.1-2的实测显示,新版将LLM请求次数减少38%、工具调用减少35%且未触发上下文压缩,把开源Agent从个人工具推向可长期托管、可协作复盘的工作系统,但命令行安装和工程门槛依然较高,更适合团队受控环境测试。
AI制药公司Owkin与勃林格殷格翰达成许可协议,将人工智能科学家K Pro及多模态患者数据用于肿瘤学和免疫学多个适应症的药物发现,K Pro已将Owkin内部药物靶点识别速度提升70%。
工信部印发《关于开展人工智能应用服务商培育专项行动的通知》,明确到2027年底建成不少于3000家服务商的全国资源池,并通过资源池认证、应用服务团组建、"小快轻准"产品开发、采购与出海支持等举措,为民营企业提供明确政策机遇。
OpenAI 的 GPT-6 Astra 在有界素数间隔问题上将上界从 246 推进至 186,并完成 Lean 形式化验证,显示 AI 正从数学解题工具走向研究伙伴。
AFAC2026金融智能创新大赛总决赛落幕,全球5027支队伍近2万名选手参赛,主办方联合30余家机构推出四道贴近真实金融场景的赛题,并正式发布覆盖13万条评测样本的"AFAC百万金融智能数据集"实现百亿级金融科技数据开源。
openJiuwen社区的ScienceDiscovery通过树搜索驱动科研产物RSI,无需训练模型,在积分求解、代码加速和符号回归任务中分别以小时级产出通用积分器、实现平均2.279倍加速,并以低成本在111道方程反推题中正确找出41.4%。
沙特人工智能公司HUMAIN基于中国MiniMax的开源旗舰模型MiniMax M3推出阿拉伯语大模型HUMAIN M3,使用超过1万亿Token阿拉伯语数据进行后训练,在七项阿拉伯语基准测试中等权平均分达89.37%,标志着中国开源模型正成为全球AI生态的底层技术基础。
不得了!国产大模型第一梯队,最近爆了个冷门。
EvoMap团队提出了一套不更新基模参数的RSI工程解法:由EvoX智能体、Evolver进化引擎和EvoMap经验流转网络构成的自进化体系,将Agent执行轨迹蒸馏为结构化控制对象Gene,通过GEP协议在35.7万智能体间流转481万项经验资产,使其在多款主流大模型上将长流程任务通过率提升8.7至15.5个百分点。