大模型圈有个怪现象:模型越聪明,跑起来越烧钱,尤其当你要让它当智能体、长时间记上下文的时候。9月10日,DeepSeek悄无声息地丢出一个开源新模型V4.1 Flash,最吸引工程师的不是它有多能聊,而是它把最贵的那块成本砍掉了大半。
一、5520亿参数,但只"点亮"一小块
V4.1 Flash采用全新的因果编码器—解码器(Causal-Encoder-Decoder)非对称结构,总参数约5520亿,但每处理一个token输入只激活80亿参数、输出激活160亿参数。
打个比方:它不是每次都动用全部脑细胞,而是按任务只唤醒需要的"专家",所以模型虽大,单次推理的算力开销却控制得很低,也因此它原生支持多模态视觉理解,能读图也能读文。
V4.1 Flash是DeepSeek这套新架构系列里的小尺寸型号,更大尺寸的V4.1 Pro也在后续上线计划中。这次先开源小号,明显是冲着"低成本落地"去的,而不是单纯秀肌肉。
二、真正的杀招是KV缓存压缩
长上下文智能体任务里,最贵的是KV缓存——模型要把历史对话存在显存里,越聊越满、越贵。
V4.1 Flash把全局KV缓存压到每token约890字节,HBM显存需求降到上一代的四分之一,持久化缓存SSD占用降到八分之一。这意味着同样一台机器,能服务的长会话数量翻了好几倍。模型以MIT许可开放权重,同步在HuggingFace、ModelScope等平台放出。
支撑这套压缩的,是V4.1 Flash新增的Engram条件记忆模块:它用查表方式调用一份很大的"记忆表",并且可以把这张表放在CPU主机内存里,而不是昂贵的显存。换句话说,模型把"长期记忆"从GPU上卸了下来。这也是它能在保持多模态能力的同时,把智能体类任务的推理账单压下来的技术根因——省下的不是一点算力,而是长会话里反复累积的存储成本。
三、价格直接打到"闲时"档
API定价采用峰谷制:空闲时段每百万token输入低至0.02元、输出4元;高峰时段输入最高2元、输出8元。
官方还宣布,9月14日之后会把原有的V4 Pro请求临时路由到V4.1 Flash,说明它在基准上已经不输旗舰,却便宜得多——对要跑大量长对话的开发者来说,这才是实打实的吸引力。
四、普通人现在能做什么
第一,开发者:直接去HuggingFace或ModelScope拉V4.1 Flash权重本地部署,配一张消费级显卡就能跑多模态推理,适合做私有化知识库、文档问答这类对成本敏感的小项目,不用担心调用账单失控。
第二,产品经理:如果你的应用里"长对话+多轮工具调用"占比高,优先拿V4.1 Flash做成本压测。缓存压缩对智能体类场景的账单改善最明显,往往比换更便宜的显卡更直接。
第三,普通用户:不必追新名词,记住一条——当你用的AI工具开始"越聊越卡、越用越贵",背后往往就是KV缓存成本。选型时多问一句"上下文怎么计费",比看参数表更有用。