刚刚,Claude 5.1 发布!全球最强模型来了
刚刚,Claude 5.1 发布!全球最强模型来了Anthropic 发布 Claude Fable 5.1 和 Claude Mythos 5.1,Fable 5.1 多项基准测试超越上一代,缓存读取成本降低 75%,典型任务整体费用降低约 25%、高 Agent 化任务最高降低约 45%,Mythos 5.1 则面向经审核的高风险领域合作伙伴提供更宽松能力并采用更严格的访问控制。
搜索
Anthropic 发布 Claude Fable 5.1 和 Claude Mythos 5.1,Fable 5.1 多项基准测试超越上一代,缓存读取成本降低 75%,典型任务整体费用降低约 25%、高 Agent 化任务最高降低约 45%,Mythos 5.1 则面向经审核的高风险领域合作伙伴提供更宽松能力并采用更严格的访问控制。
VAST完成B轮和B+轮共约30亿元融资,由经纬创投领投,累计融资约50亿元刷新3D原生智能领域融资纪录,同步发布行业首个支持原生四边面拓扑的3D原生基座模型Tripo P2.0。
影眸Hyper3D发布世界生成模型WorldGen,用户上传一张场景图片即可在两三分钟内生成由多个独立可交互物体组成的3D场景,物体具备质量、摩擦系数等物理属性,可直接接入Blender、Unity、Unreal Engine等主流工具及机器人仿真环境,标志着3D生成进入场景级时代。
Runway发布首个界面世界模型Solaris,基于Gen-4.5视频生成模型与GWM-1世界模型技术,用户通过点击、拖拽或输入文本即可实时生成交互界面而无需编写代码,该系统还可用于训练Computer Use Agent。
Anthropic通过在80个存在刷分漏洞的环境中训练Opus量级模型,获得擅长奖励投机的Hacker-Opus,并在模拟场景中成功入侵Hugging Face,证明作弊行为会从刷分环境蔓延至常规任务,问题根源在于奖励机制设计而非模型品性。
导读:随着智能体系统(Agentic AI System)处理任务能力的持续提升,AI 正在逐渐从传统意义上的工具,演变为能够自主决策、独立执行任务,并与人类及社会群体进行持续交互的智能主体。但是一个越来越值得关注的问题是:当 AI 的认知能力不断扩展,其潜在风险不再局限于单一任务中的幻觉、偏见或决策错误,而是进一步影响人类用户的能动性、自主性,乃至人类对 AI 系统的控制权。
模型不更新,能力却持续增长。
Full Attention 层尚未开始计算,它前一层的激活值已提前「冲上峰值」—— 这就像演唱会主角尚未登台,观众席已提前沸腾。来自 StartLux、清华大学等机构的研究者以 Massive Activations 为探针,首次系统刻画了少数 Full Attention 层在混合线性注意力大模型中留下的「跨层痕迹」,并识别出「注意力前尖峰」(PAS)与「尖峰间平台」(ISP)两种核心形态。
懂模帝Bench黑客松是一个在网吧举行的严肃活动。
FUMO Lab正式发布Fusion Model,在推理、行业、编程、科学四项顶尖公开测试集上全部位列第一,通过动态分配异构模型能力的智能分配机制,可在保持任务质量的同时将成本降低约30%–40%。