清华沃顿师徒破解40年悬案!核心数学全是GPT写的,你上你也行
清华沃顿师徒破解40年悬案!核心数学全是GPT写的,你上你也行训练一切AI的算法,被AI自己判了「死刑」?就在最近,清华大学和宾大沃顿商学院的两位研究者挂出一篇新论文,给了一个优化理论界等了40年的结论——梯度下降想跑到最快,光调步长没用。
搜索
训练一切AI的算法,被AI自己判了「死刑」?就在最近,清华大学和宾大沃顿商学院的两位研究者挂出一篇新论文,给了一个优化理论界等了40年的结论——梯度下降想跑到最快,光调步长没用。
Claude Opus 4.6的轻量平替,只需要 27B 参数,你信吗?最近发布的Qwen3.8-27B,就顶着这样的评价火遍了开源社区。上线两天,下载量突破100万次,登顶Hugging Face全球大模型趋势榜。
本周五,AI 社区热烈讨论的是一个端侧大模型部署技术,它能让笔记本 RTX 4060 跑 Qwen 3.6-35B,桌面 RTX 5090 跑得起 DeepSeek-V4-Flash 284B。而且都是单卡,模型都是满血的。Codex 生产 trace 的中位 decode 速度是 33 token/s
等了四个月,DeepSeek的多模态模型:deepseek-v4-flash-vision-exp,终于发布。我也是第一时间赶到现场,连夜开始实测。相比V4 Flash最大的不同,就是支持原生支持图片输入了,但图片生成当然还是没有的。
看到形界智能「Era」系列的原生模型Rise正式发布了,用500ms的端到端响应延迟,让人机交互,有了新的变量。第一时间测试了一下,给大家介绍介绍。全域沉浸,一种全新的视频交互形态
这期节目的嘉宾黄东旭,就是Token Maxing热潮的亲历者。他曾经只用最前沿的模型,每天账单三四百美元。让他转变的,是前沿模型的智力碾压和中国开源模型们的崛起——Fable 5可以一句话终结Agent群的讨论,同时大量的日常任务可以做到“只烧电费,不烧Token”。他的结论是:不是前沿模型用不起,而是本地开源模型底座+前沿模型的搭配,成本可控,更具性价比。
商汤科技这次正式开源的SenseNova U1.5 Lite,其亮点如下:而且啊,SenseNova U1.5 Lite依旧保持了8B的大小,还能在复杂排版与精准编辑等核心的场景上比肩闭源的GPT-Image-2:
位于北京海淀的互联网金融中心,任利锋创办的“数美万物”在这里有3个办公地点。其中的一间不是办公室而是实验室,他们采购来市面上主流的3D打印机,在实验室桌面上次第排开,每天打印自研生成式3D模型生成的东西。经自研模型Hi3D生成的图纸打印出的实物有没有破面或其它瑕疵,又如何改进、修补,都在这间屋内见分晓。
据一位知情人士透露,Nvidia已就投资Mercor展开讨论。Mercor是一家数据标注服务商,协助这家芯片设计商开发其开源AI模型。此次投资将作为一轮估值200亿美元融资的组成部分。现有投资方General Catalyst已在洽谈领投本轮融资。
JiuwenBox 的定位,可以用一个比喻说清:给 AI 干活的临时房间。它和 WorkSwarm 是这么配合的:用户在 WorkSwarm 里发一个任务,Agent 负责把任务想清楚、拆成几步;每一步要跑的命令、要运行的代码、要碰的文件,统统送进 JiuwenBox 的沙箱去执行。Agent 负责 "出主意",沙箱负责 "安全地动手"。