沙特HUMAIN基于MiniMax M3推出阿拉伯语大模型,中国开源模型走向全球底座
沙特HUMAIN基于MiniMax M3推出阿拉伯语大模型,中国开源模型走向全球底座沙特人工智能公司HUMAIN基于中国MiniMax的开源旗舰模型MiniMax M3推出阿拉伯语大模型HUMAIN M3,使用超过1万亿Token阿拉伯语数据进行后训练,在七项阿拉伯语基准测试中等权平均分达89.37%,标志着中国开源模型正成为全球AI生态的底层技术基础。
搜索
沙特人工智能公司HUMAIN基于中国MiniMax的开源旗舰模型MiniMax M3推出阿拉伯语大模型HUMAIN M3,使用超过1万亿Token阿拉伯语数据进行后训练,在七项阿拉伯语基准测试中等权平均分达89.37%,标志着中国开源模型正成为全球AI生态的底层技术基础。
训练一个大模型之前,语料需要经过解析、清洗、去重、质量评分、Token化和样本组装。
微软与UIUC合作研究StudentSim框架,基于真实学生数据训练个性化学生模拟器,具备behavioral fidelity和guidance responsiveness两项能力,在国际象棋等三个领域验证其优于现有基线,并可作为AI教师强化学习的高通量奖励信号。
2026年9月3日,嬴彻科技宣布其卡车自动驾驶商业运营里程突破10亿公里,形成行业最大规模的真实运营数据资产。
强化学习与可验证奖励(RLVR)已成为提升视觉语言模型(VLM)推理能力的标配手段。但一个隐蔽的问题始终存在:最终答案的奖励信号,只告诉模型「答对了没有」,却从不告诉它「答案应该从图像的哪个区域得出」。答对,可能是因为真的看懂了图,也可能只是语言先验的捷径、数据集的偏差,甚至是一次幸运的瞎猜。
由两名00后大学生创办的美国AI训练数据公司AfterQuery五个月内估值从3亿美元升至32亿美元,其数据已用于英伟达Nemotron 3 Ultra模型训练,并与Thinking Machines Lab、Legora及部分中国AI实验室合作。
除了电力之外,在这一轮AI数据中心扩产潮中,中国另外两个天然优势,也被海外发现了。
一个 Agent 到底凭什么越来越强?有人靠更大的模型,有人靠更多数据。就在前天,Google Research 最新发布的 WikiSkill 给出了另一条答案:给 Agent 搭一套三层知识架构,让技能自己进化。
COCO Matrix CEO高宇翔在访谈中提出,真实世界不可能被提前穷举,具身智能应将In-Context Learning作为核心范式,让机器人通过现场示范和纠正直接适应新任务与新环境,而非每遇到新任务都依赖重新采集大量数据并训练模型,从而显著降低部署门槛和适配成本。