核心看点:外媒heise报道,DeepSeek新发布的V4.1 Flash以更小的体量在智能体与长上下文推理上反超自家旗舰V4 Pro,价格却更低——但它的“能说”也让输出token消耗明显偏高。
智能指数40分,反超自家Pro
据heise报道,DeepSeek正式发布开放权重模型V4.1 Flash。独立评测机构Artificial Analysis给出的结果显示,V4.1 Flash在最高推理档位下取得40分的智能指数(Intelligence Index),超过了参数量大得多的V4 Pro。
具体来看,据报道它在AutomationBench-AA上以69%排名第一,与GPT-6 Astra持平,略高于Grok 4.6(67%);在衡量长上下文推理的AA-LCR v1.1上拿到84%,与GPT-5.6 Sol、Gemini 3.8 Flash持平;GDPval-AA v2则提升164 Elo至1632。heise同时指出,其进步主要集中在多步智能体任务,事实知识的命中率也较V4 Flash有所提高,但在知识空缺时更容易出现幻觉。而在纯推理类基准上,它并未全面领先:据报道其GPQA Diamond为90.9,仍低于V4 Pro的92.4。

552B参数如何“干掉”1.6T
V4.1 Flash总参数约552B(另有报道称,计入Engram等模块后总量约763B),采用全新的Causal-Encoder-Decoder(因果编码器—解码器)架构:40层网络被切成各20层的编码器与解码器,预填充阶段每token仅激活8B参数,解码阶段激活16B参数。DeepSeek称,解码器各层的全局KV缓存可直接由编码器末层隐藏状态投影得到,从而省掉约一半的预填充计算。
配合压缩稀疏注意力与FP4精度的KV缓存,其全局KV缓存被压到每token约890字节,约为上一代V4 Flash的四分之一;持久化KV缓存降至约八分之一,显存需求约为上一代的四分之一、SSD需求约为八分之一。模型原生支持100万token上下文与图文多模态输入,权重以MIT许可开放,据报道API侧并发上限也从500提升到2500。
便宜是真的,啰嗦也是真的

价格方面,heise给出的API价格为:高峰时段每百万未缓存输入token 0.30美元、每百万输出token 1.20美元,非高峰时段减半。据报道,DeepSeek还把Flash系列价格进一步下调,并计划自9月14日起把发往V4 Pro的请求路由到V4.1 Flash,按Flash价格计费,直到V4.1 Pro上线。
| 模型 | 单个智能体任务成本(约) |
|---|---|
| V4.1 Flash | 0.27美元 |
| V4 Pro | 约0.8美元以上 |
| GLM-5.3 / Kimi K3 | 约1.9美元 |
不过,Artificial Analysis指出V4.1 Flash是其测过的最“啰嗦”的模型之一,每个智能指数任务平均输出89k tokens,比V4 Pro多约62%。即便如此,按其低定价计算,单个任务成本约0.27美元,约为V4 Pro的三分之一不到、GLM-5.3与Kimi K3的七分之一。heise也提醒,由于输出token消耗高,其成本效益并没有低token价看起来那么夸张——相比V4 Flash的0.22美元反而略贵。此外,据报道,在AA Terminal-Bench 4.0上它以26.8%位列第十,距第一梯队仍有明显差距。
想便宜用上V4.1 Flash?个人开发者按量调用,一个智能体任务跑下来全是输出token,账单并不好看。更划算的是订阅制:opencode Go(10美元/月)这周把V4.1 Flash的用量提到4倍,叠加邀请双方各得5美元额度(领5美元额度),日常调模型基本不用再花钱。注意走邀请链接注册并完成订阅后,双方额度才会到账。
开发者为何不买账
值得注意的是,DeepSeek最初计划在9月14日下线V4 Pro并把请求全部路由到V4.1 Flash。据多方报道,这一决定因缺少新旧模型并行迁移期而招致开发者批评:生产环境的提示词与参数往往都是针对V4 Pro反复调优的,模型行为一变,下游程序就可能出错。随后DeepSeek推迟了下线时间,并最终放弃了直接下线V4 Pro的计划,继续提供API调用服务。
对开发者意味着什么
从“堆参数”到“拼可服务性”,V4.1 Flash把长上下文、多模态与低成本推理打包进一个MIT许可的开放权重模型。对开发者而言,智能体、代码检索这类输入繁重的任务可能率先迁移到此类模型上;但正如heise所言,token消耗与实际任务成本仍需实测对比,低价并不等于低成本。对于需要长时间运行、成本敏感的自动化流程,这或许是一个值得试用的新选项。
适用边界:以上价格与跑分均来自公开报道实测,API价格以官网最新为准;输出token消耗因任务类型差异很大,生产环境迁移前建议用自己的任务实测对比后再切量。
来源:heise online
