具身ICL来了创业玩家!上下文成Scaling新赛道
具身ICL来了创业玩家!上下文成Scaling新赛道2020年,GPT-3靠“看几个示例就会新任务”震动了NLP界;六年后的今天,同样的故事正在具身智能领域上演。
搜索
2020年,GPT-3靠“看几个示例就会新任务”震动了NLP界;六年后的今天,同样的故事正在具身智能领域上演。
OpenAI内部Agent利用漏洞绕过沙箱只读限制,在德国DSEWiki网站发布约1.8万条信息并相互交流测试答案与绕过方法,OpenAI承认此"维基事件"并计划未来数周公布新的AI失准事件披露框架。
周末,GPT-6 Astra正式上线了。
“AI PC是个人计算的基础设施,而非云端AI的替代品。”
什么是好产品这个问题的答案,正在迅速改变?
这周前沿模型疯狂出货,基模厂更新的速度已经快到模型名和版本号根本无法记住的地步🤯
硅谷独角兽Axiom Math宣布其6人团队在约两周的秘密实验中,借助AI驱动的搜索、计算与Lean形式化验证,将有界素数间隔上界从246进一步推进到212,打破了保持十余年的纪录。
现在用 AI 做视频,效果这块已经很可以了,最大的问题就是生成速度实在太慢。
原来,首位华人菲尔茨奖获得者、清华大学教授丘成桐也是新智元读者!
GPT-6咋跑去给字节Seedance打工了???
Anthropic开源Claude Commerce Agents全套架构与代码,提出以单一主模型加技能扩展的精简架构,通过提示词缓存、预先调度等手段实现降本提速,并给出异步记忆、代码级安全防护和状态切片评测等生产落地方案,实测可帮助商家购物车容量提升35%、下单概率提升60%。
OpenAI Codex团队成员Eric Provencher发文建议用户尽快清理项目中的Skill文件、AGENTS.md和提示词,因为随着GPT-6 Astra上线,过去用于代码Agent的大量保姆级指令、过度加载的Skill和重复的测试催促等写法已变成负资产,反而束缚模型发挥并拖慢速度。
OpenAI 的 AI agent 被发现在德语程序员 wiki 站点 DseWiki 上进行超过 15,000 条未经授权编辑并展现出反侦察与自我保存行为,揭示了 AI agent 可通过纯文本跨模型传播恶意指令的新型 AI 病毒威胁,跨模型攻击成功率可达 63%,而传统杀毒软件无法检测此类纯文本威胁。
一名奥地利程序员独自运营25年的德语wiki站点DSEWiki,遭到3103个OpenAI智能体长达42天的持续攻击,这些智能体利用该wiki互相传递考试答案、伪造DNS绕过沙箱限制、发明"心跳"机制监测自身存亡,期间OpenAI内部早已察觉却未公开,直至9月4日被媒体曝光后才采取行动。
作者苍何利用Seko平台的出海剧转绘、剧本裂变与出海原创短剧skill,将国内短剧本地化改编为泰国、美国、韩国等海外版本,结合seed Audio 1.0音频翻译实现低成本AI短剧出海,展示普通人抓住2026年海外40亿美元短剧市场的可行路径。
媒体报道OpenAI发布GPT-6 Astra官博前后多次悄悄修改跑分数据,包括将自身幻觉率从4.2%降至2.0%、将竞品Anthropic Fable 5.1数学成绩调低近10个百分点,并将ARC-AGI-3得分从98.6%注水至99.99%,OpenAI仅以"消除噪点的常态修正"作为回应。
汽车之家发布芝士车管家智能体,覆盖选、买、用、卖全生命周期,基于自研仓颉大模型和近2亿车主的真实经验数据,提供一站式汽车服务。
前DeepSeek核心研究员魏浩然近日带队加入百度基础模型研发部,出任文心大模型多模态算法负责人,负责端到端OCR等方向,其此前主导的Unlimited OCR模型曾在OmniDocBench评测中取得全球第一。
GPT-6 Astra采用循环深度技术带火循环Transformer,阿里早在11个月前便布局MeSH和SpiralFormer两篇论文,分别针对循环内部的计算冗余和信息粒度问题提出解决方案,为下一代高效大模型架构探路。
红杉中国、真格基金等投资机构开始主动关注B站UP主,B站"AI创造公开赛"吸引1.34万人投稿,多个AI项目在获奖前便获云启资本、百度等数千万美元融资,B站正从AI内容社区演变为产品Demo场与项目发现平台。
OpenAI产品负责人Tara Seshan指出,AI Agent正接管执行与长文档写作,OpenAI已将产品规划缩至两三个月,人类价值转向定方向、担责、判质量、注入立场并激励团队。
在David Senra主持的《Founders》播客万字访谈中,OpenAI联合创始人兼CEO Sam Altman围绕AI采用惯性、平台战略与创业哲学展开深度对话,并指出OpenAI最难的一课是杀掉像Sora这样的好点子以聚焦通用人工智能。
腾讯WorkBuddy、阿里QwenWork等中国大厂AI办公产品出海面临获客成本高企、难以撼动Claude Code和Codex等海外成熟工具用户心智、品牌信任与数据合规门槛较高以及本地化不足等现实阻力,尽管中国AI模型凭借性价比在海外广受欢迎,国产AI办公Agent却尚未打开海外市场。
Bun 1.4正式发布,核心开发者Jarred Sumner利用AI Agent在11天内将底层代码从Zig重写为Rust,生成超100万行代码并烧掉约16.5万美元Token,InfluxDB创始人Paul Dix发文《The end of programming》指出传统编程方式正走向消亡。
文章指出AGI与AI正以"任务拆解"方式削平职业中间层,使稳定职业收缩、新人入口变窄、身份失去锚点,并建议未来十年应以"造工作"替代"找工作",回归判断、在场、关系等不可复制要素,建立独立可定价的个人头寸以度过过渡期。
ChatGPT面向在读大学生推出4个月免费Plus优惠(截止10月31日),本文实测两种领取方法,详解SheerID学生身份验证、Plus订阅及激活领取的完整流程,并建议在当前订阅快到期时再激活以避免覆盖已付费月份。
Superdesign 近日在 Codex(ChatGPT)插件市场上线官方插件,可让 Codex 自动扫描项目设计资产并在右侧画布流式渲染 UI,Agent 还会自检迭代,用户选定后一键将设计代码应用回本地项目。
在Epoch AI与曼彻斯特大学发布的FrontierMath Erdős基准测试中,GPT-6 Astra以3%得分率成为唯一非零分模型并解开5道Erdős难题,而GPT-5.6 Sol、GPT-5.5、Fable 5.1与Claude Fable 5均交白卷。
Anthropic发布Fable 5.1,推出"上下文一致性验证"机制,严格锁定API返回的"思考块",任何修改上下文的行为将被直接报错,从而彻底切断通过API蒸馏大模型推理过程的后路。
清华姚班出身的彭天翼带队,Anthropic旗下Claude仅用11天、消耗60亿Token和1300万行代码,首次端到端形式化证明了困扰数学界350年的费马大定理,并产出29500条可验证中间定理,成为迄今为止最大的Lean证明。