GPT-6 Astra 实测,Blender 刷屏之后还能怎么玩
GPT-6 Astra 实测,Blender 刷屏之后还能怎么玩模型正在接手更多复杂工具。
搜索
模型正在接手更多复杂工具。
上周,《后西游记》在湖南卫视黄金档时段上映。
模型定上限,Agent 定下限。
家人们,DeepSeek V4.1 Flash 开启内测了。
千问办公,给AI办公补上缺口。
OpenClaw 2.0(v2026.8.1)对比前代v2026.7.1-2的实测显示,新版将LLM请求次数减少38%、工具调用减少35%且未触发上下文压缩,把开源Agent从个人工具推向可长期托管、可协作复盘的工作系统,但命令行安装和工程门槛依然较高,更适合团队受控环境测试。
实测首个AGI级别模型GPT-6,用一张白宫照片在22分钟内生成可自由漫游和调光的三维场景,并完成秦始皇骑北极熊的SVG动画、一句话制作马里奥风格赛车游戏及模仿孙宇晨风格的短文写作,展现其根据简短需求主动补全细节的能力。
豆包工作新增多Agents并行与Mac电脑GUI操作两大功能,实测可完成Mac mini购机配置调研、自动撰写邮件草稿、调整长辈电脑系统设置及批量定时发送微博等任务。
Anthropic前脚刚发布了Fable 5.1(具体可见Claude最强Fable 5.1发布!8项屠榜,最高降价45%,反蒸馏机制上线),后脚第三方权威跑分和个人第一手实测已经出炉了!
工作,是真的能先交给豆包工作了。
阿里千问新模型,又卷出了新水平。
8月14日,一个叫Cocode的项目悄悄出现在GitHub上,简介写得很直白,基于DeepSeek Harness构建的开箱即用发行版。不到两周,它拿到150多个star,并在8月25日发布了v1.0.2。
AI短剧的女主接一条广告,60秒报价25万元。另一边,一条AI天宫短片在海外刷屏,零推广、小成本,数以万计的海外观众追着去搜中国神话。做出这条短片的栖光,是成都一名90后眼镜店老板,没学过影视,也没有团队,AI创作只是他坚持了两年的业余爱好。这条刷屏的天宫短片,正是用Pavo做出来的。
刚刚,豆包正式发布了一款新产品——豆包工作。全新 Logo、独立的桌面客户端,它的定位很明确:一个面向生产力场景的全新 Agent 产品与品牌。
第一次测试这个 Skill 时,我没有让 Flova 生成任何画面。
Claude Opus 4.6的轻量平替,只需要 27B 参数,你信吗?最近发布的Qwen3.8-27B,就顶着这样的评价火遍了开源社区。上线两天,下载量突破100万次,登顶Hugging Face全球大模型趋势榜。
等了四个月,DeepSeek的多模态模型:deepseek-v4-flash-vision-exp,终于发布。我也是第一时间赶到现场,连夜开始实测。相比V4 Flash最大的不同,就是支持原生支持图片输入了,但图片生成当然还是没有的。
8 月 13 日,DeepSeek 开源 Agent Harness dsh,将 “Harness” 这个原本更偏工程语境的概念,推到了整个 AI 行业讨论的中心。
不会写代码,能不能做出一款自己的游戏?
《读佳》获知,字节正在内测一款漫剧创作产品,名字就叫“漫剧创作工具”,Slogan“让创作更纯粹”,搭载豆包多个大模型。
上回说到,Seedance 2.5上线后,我们第一时间做了模型更新的能力测试。结果很惊艳,AI的指令遵循、运动效果、表演张力、人物一致性和全模态参考都有了大进步。
上周一,我发了自己做的AIHOT大模型排行榜。
Kimi K3 发布十天后,AI 原生云服务商 Together AI 公布了一份独立评测报告。
每天1000个注册名额,凌晨6点刷新,用完了就得进Waitlist排队,等短信通知。
在AI应用生成这个赛道上,选手已经排到了两位数。腾讯有吐司,百度有秒哒,字节有Trae,阿里自家就有Qoder,现在又冒出来一个「袋马」。
上一篇我用 Doubao-Seed-Evolving,把复杂 PRD 拆成可执行工程,做成了 AI 教学视频平台。那次重点是“知识驱动出片”:学科知识点 → 教学分镜 → 配音 → 动画 → 1080p 成片。
8 月 3 日,Qwen 官方正式发布 Qwen3.8-Max。
DeepSeek-V4-Flash风评冲爆了,原生支持接入Codex,而且还强化了Agent能力。我第一时间把它接进了Codex,用cc swich非常方便。一个小时,跑了一亿多token。跟大家说说体感。
7月27日,美团正式上线了CatPaw,一个全场景AI Agent平台。准确说,是「内部练了三年,现在放出来给所有人用」。
谷歌的前端功底有多深,不需要任何人来认证。