DeepSeek V4.1 Flash 开源:全新架构

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
DeepSeek V4.1 Flash 开源:全新架构
6595点击    2026-09-10 16:58

刚刚,DeepSeek 开源了 V4.1 Flash,原生支持视觉理解,也是全新架构系列中最小的一款模型,550B 总参数,输入时激活 8B,输出时激活 16B(你没看错,输入输出激活不同)


DeepSeek V4.1 Flash 开源:全新架构


对于这套全新基座,其设计目标便是:能力上限更高、推理速度更快、吞吐更大、可扩展到更大参数模型


配套的 DeepSeek Harness 同步更新至 v0.1.5,模型针对其中的不同运行配置做了专项训练。而在 API 中,这一代 Flash 接替上一代 Pro:V4 Pro 将有序下线,相关 API 请求转向 V4.1 Flash,并按新模型的价格计费


DeepSeek V4.1 Flash


V4.1 Flash 的主要提升集中在 Agent 任务上。相比 V4 Pro,DeepSWE v1.1 从 62.7 提升到 74.2,Terminal-Bench 3.0 从 11.8 提升到 30.0,Automation-Bench 从 43.2 提升到 54.8,CyberGym 从 83.3 提升到 88.1


在官方列出的对比模型中,V4.1 Flash 在 DeepSWE v1.1、CyberGym 和 Automation-Bench 三项测试上得分最高,超过了表中的 Kimi K3、GLM 5.3、Opus 5 和 GPT 5.6-Sol


DeepSeek V4.1 Flash 开源:全新架构

DeepSeek V4.1 Flash 与其他模型在 Agent 测试中的表现


不过,各项能力的进展并不齐整。V4.1 Flash 在 GPQA Diamond 上的得分仍低于 V4 Pro,在 Terminal-Bench 3.0 等测试上也没有超过表中的全部竞品。更准确地说,它在多项 Agent 测试中超过了上一代 Pro,部分成绩达到所列前沿模型中的最高水平


DeepSeek V4.1 Flash 开源:全新架构

DeepSeek V4.1 Flash 完整基准测试结果


550B 总参数,输入只激活 8B


V4.1 Flash 采用 MoE 结构,总参数量为 550B,输入阶段激活 8B,输出阶段激活 16B


这次的新结构,把处理输入与生成输出做成了不对称的两部分。输入使用较小的激活规模,输出使用较大的激活规模;550B 描述的是模型的总参数量,8B 和 16B 描述的是相应阶段参与计算的参数规模,两者不能混为一谈。


按照发布稿的介绍,这套非对称编码器—解码器结构,目标是在提高能力上限的同时,降低推理成本、提高速度和吞吐量,并继续扩展到更大参数规模。V4.1 Flash 是这个新系列中最小的一款,同时采用了新的预训练方式,以及更大规模的强化学习后训练


长上下文的费用下调


另一项变化在缓存,模型处理过的上下文,可以通过 KV Cache 保存一部分中间计算结果。后续请求中的相同前缀命中缓存时,便可以复用这些结果,不必每次都重新计算


按 DeepSeek 公布的数据,V4.1 Flash 每个 Token 的 KV Cache 从上一代 V4 Flash 的 3514 字节降到了 890 字节,约为此前的四分之一。与初代 DeepSeek V1 相比,则缩小到了约 1/437


DeepSeek V4.1 Flash 开源:全新架构

DeepSeek 历代模型的每 Token KV Cache 大小


发布稿同时给出了两个存储口径:与上一代相比,缓存相关的 HBM 需求降至 1/4,SSD 需求降至 1/8。这里说的是缓存资源,不能直接理解为整个模型的部署显存也降到了四分之一


配套的 Harness 更新也涉及缓存:使用 V4.1 Flash 时,新版 DeepSeek Harness 支持在保留已有 KV Cache 的情况下更新系统提示词


这些成本变化反映到了 API 定价上。新价格自 北京时间 2026 年 9 月 10 日 12:00 生效,继续采用峰谷定价,闲时价格为高峰时段的一半。单位均为人民币元/百万 Token


时段:空闲时段

输入:缓存命中:0.02 元

输入:缓存未命中:1 元

输出:4 元


时段:高峰时段

输入:缓存命中:0.04 元

输入:缓存未命中:2 元

输出:8 元


高峰时段为工作日北京时间 9:00—12:00、14:00—18:00,其余时间均为空闲时段,包括周末休息日。


同样是 100 万输入 Token,闲时缓存未命中收 1 元,命中缓存收 2 分钱,两者相差 50 倍。不过,任务总费用还要加上未命中的输入和输出,不能把缓存单价当成全部 Token 的价格。


举个假设的账单:一批任务累计产生 1 亿缓存命中输入 Token、100 万未命中输入 Token,以及 10 万输出 Token。按上述单价计算,全部在闲时执行,费用为 2+1+0.4=3.4 元;同样的用量全部在高峰时段执行,则为 6.8 元


配套的 Harness 一起更新


DeepSeek Harness 是让模型读取和修改文件、运行命令、调用工具,并持续执行任务的运行环境。它提供 Web 界面,用户可以选择工作区、发起任务,再查看模型的执行过程与结果


这次的 v0.1.5 与 V4.1 Flash 的训练做了深度结合。模型针对 标准模式、程序化工具调用(PTC)模式和极简模式 都进行了专项训练和优化,适配覆盖了不同的工具使用方式


文件处理也补齐了不少环节。Web 界面现在可以上传图片、PDF 等文件,由模型通过文件工具按需读取;右侧边栏可以浏览工作区文件树,预览 Markdown、HTML、PDF、常见代码和图片。模型生成的文件可以直接在侧边栏查看,也可以交给系统默认应用打开,或在文件管理器中定位


在任务执行过程中,父 Agent 与可继续对话的子 Agent 支持双向通信,可以补充信息、调整任务方向。主 Agent 能为子 Agent 选择模型和推理强度;用户则可以排队发送消息,编辑、删除待处理消息,也可以插话或停止任务


新版还提供了实验性的 Agent Teams。主 Agent 可以创建多个团队成员,通过共享任务列表拆分、分配和跟踪工作,成员之间能够互发消息,最后由主 Agent 汇总结果。这个功能默认关闭,需要通过实验性插件启用,使用时会产生额外 Token 消耗


插件的界面入口也更明确了。左侧边栏允许插件注册全局入口,并与中央内容面板联动;右侧可以注册新的标签页,通过多标签、分栏或全屏展示内容。长会话的加载、恢复、内存占用和历史导航也做了优化,后续计划加入内置插件管理面板


DeepSeek 分享的社区案例里,已经有开发者用 V4.1 Flash 与 Harness 做出剪纸风游戏《纸虎》,案例标注为“两轮提示词制作”;另一项展示则是三棱镜光学渲染


DeepSeek V4.1 Flash 开源:全新架构

社区案例:两轮提示词制作的剪纸风游戏《纸虎》


DeepSeek V4.1 Flash 开源:全新架构

社区案例:三棱镜光学渲染


怎么用


按照此次发布安排,V4.1 Flash 已上线 DeepSeek API,模型名称设为:


deepseek-flash


旧版 V4 Flash 与 V4 Flash Vision Exp 下线,原有的 deepseek-v4-flashdeepseek-v4-flash-vision-exp 两个模型名暂时路由到 V4.1 Flash,以兼容已有调用


北京时间 2026 年 9 月 14 日 12:00 之后,至未来 V4.1 Pro 上线之前,发往 deepseek-v4-pro 的请求也将全部路由到 V4.1 Flash,并按 V4.1 Flash 单价计费


腾讯 WorkBuddy、CodeBuddy,以及 OpenCode,作为官方合作伙伴已全量接入新模型


使用 DeepSeek Harness,可以在已安装 Node.js 开发工具链的系统中运行:


npx @deepseek-ai/dsh web


启动 Web 界面后,在设置中填写 DeepSeek API Key,再选择工作区,即可开始任务。如果需要从源码安装,则获取项目仓库,并按仓库说明完成配置:


git clone https://github.com/deepseek-ai/deepseek-harness


模型与 Harness 的使用反馈,可以通过界面中的点赞、点踩,或 /feedback 命令提交


模型开源


发布稿提供了 V4.1 Flash 的模型与技术报告入口。DeepSeek 表示,将支持开源社区进行新模型的推理适配,并探索扩大部署范围;对于有大规模部署需求、具备约 2000 张 GPU 和存储集群资源的团队,也开放合作联系


模型:


https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash


技术报告:


https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/DeepSeek_V41_Tech_Report.pdf


文章来自于"赛博禅心",作者 "金色传说大聪明"。

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
文件重命名

【开源免费】ai-renamer是一个用AI帮你做文件夹或者图片命名的项目。该项目会根据文件夹或者图片内容来为文件进行重新命名,让你的文件管理更加便利。

项目地址:https://github.com/ozgrozer/ai-renamer

2
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

3
prompt

【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。

项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md

在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0