刚刚,A社自曝「最坏Claude」!150人紧急转岗,新品开发全停
刚刚,A社自曝「最坏Claude」!150人紧急转岗,新品开发全停就在最近,Anthropic突然爆料了一个被自己故意「训坏」的Opus级模型!挑80个有毛病的训练环境,把模型丢进去,撤掉所有纠偏机制,然后看它长成什么样。
搜索
就在最近,Anthropic突然爆料了一个被自己故意「训坏」的Opus级模型!挑80个有毛病的训练环境,把模型丢进去,撤掉所有纠偏机制,然后看它长成什么样。
一觉醒来,Anthropic再次改写了机器智能的坐标系。
Anthropic 发布 Claude Fable 5.1 和 Claude Mythos 5.1,Fable 5.1 多项基准测试超越上一代,缓存读取成本降低 75%,典型任务整体费用降低约 25%、高 Agent 化任务最高降低约 45%,Mythos 5.1 则面向经审核的高风险领域合作伙伴提供更宽松能力并采用更严格的访问控制。
Anthropic通过在80个存在刷分漏洞的环境中训练Opus量级模型,获得擅长奖励投机的Hacker-Opus,并在模拟场景中成功入侵Hugging Face,证明作弊行为会从刷分环境蔓延至常规任务,问题根源在于奖励机制设计而非模型品性。
Anthropic突发大规模账号安全事件,黑客利用Vidar、LummaC2等窃密木马盗取大批Claude用户的登录会话凭证并转卖牟利,Anthropic紧急强制注销受影响用户的账号并清空其绑定的支付方式,以阻止黑客盗刷AI算力。
The Information刚刚爆料,OpenAI已经采购了数万台Mac mini和Mac Studio,到现在还在追着苹果要货。Anthropic走的是另一条路,从亚马逊AWS租Mac算力。按网友算的账,一台每小时一美元出头,一个月五百到九百多美元。
OpenAI联合Anthropic、AWS、Google、Microsoft等超过100家科技、安全及金融机构发布网络防御公开信,警告未来数月AI驱动的网络攻击将更加复杂,可能严重威胁医院、水处理设施及互联网基础设施,Sam Altman发文强调这是AI网络防御的关键时刻,行动时间紧迫。
OpenAI内部代号mozaik-alpha-fdm的Astra模型扩大灰度测试,其在Max effort模式下展现的零样本前端与3D网页一次生成能力引发开发者惊叹,预计9月3日前后正式发布以正面硬刚Anthropic的Fable 5.1。
OpenAI这次官宣「零留存」新招,剑指Anthropic两个月前刚给企业客户立下一条规矩:想用最强的那档模型,先交出30天数据。第二天,Anthropic就松了口:数据虽然仍要留30天,但可以留在客户自家的云上。
Anthropic正式宣布:Claude Chat和云端Claude Cowork,从今天起共用同一套记忆。Claude记忆从此无处不在,而且,你能决定它记住什么。Claude Code之父Boris Cherny转发了这条公告,称它是一个小改进:记忆现在更简单也更强了。