从V4-Flash-0731到V4.1 Flash:一次能力跃升的路径分析作者:殷晓雯日期:2026年9月12日
定位说明:本文仅从公开可查的基准测试数据出发,分析两代模型之间的能力增量类型,不针对任何特定企业或具体事件。文中标注【事实】的内容来自公开基准测试平台,标注【推演】的内容为基于公开数据的逻辑分析。
一、两代模型之间发生了什么【事实】DeepSeek V4-Flash-0731发布于2026年7月31日。V4.1 Flash发布于2026年9月10日。两者相隔约六周。
【事实】从公开基准测试数据看,V4.1 Flash相比V4-Flash-0731的提升,集中在以下维度:
Terminal-Bench 3.0:从7.6提升至30.0
Terminal-Bench 4.0:从7.0提升至31.2
Automation-Bench:从37.7提升至54.8
DeepSWE v1.1:从54.4提升至74.2
这些基准测试衡量的不是“文本生成是否流畅”,而是多步骤工具调用、跨会话任务执行、长程目标保持、复杂环境下的自我纠错能力。
二、这个提升路径意味着什么【推演】一个模型的能力增量,可以从两个层面获得:数据层面和架构层面。
数据层面,是让模型“知道更多”或“输出更像某个东西”。架构层面,是改变模型“怎么处理信息”的内部机制。
这两种改进路径,在基准测试上的表现特征不同:
如果一次迭代主要是数据层面的改进——比如更换训练数据、增加数据量、调整数据配比——那么提升通常集中在知识覆盖、单轮问答质量、输出风格接近度上。长程任务的改善往往是渐进的,因为数据能改变“知道什么”,但改变不了“怎么在多个步骤之间保持一致性”。
如果一次迭代涉及架构层面的改进——比如改变注意力机制、优化KV缓存策略、新增推理链路的某个模块——那么提升可能集中在需要持续运行、跨步骤保持目标、动态调整策略的任务上。因为架构改变的是信息处理机制本身。
【推演】V4.1 Flash的提升分布,更符合后一种特征:长程Agent任务大幅跃升,普通单轮任务提升幅度相对有限。从7月底到9月初,六周时间内,在训练数据没有发生根本性变化的前提下,长程任务指标出现这种幅度的跃升,更可能来自架构层面的改动。
三、蒸馏能拿到什么,拿不到什么【推演】蒸馏技术的本质,是让一个模型去模仿另一个模型的输出。它能拿到的是:输出文本的风格、表层答案的表述方式、特定问题的回答模式。
它拿不到的是:产生这些输出的内部运行机制。
一个模型在回答问题时,内部发生了什么——如何在多个步骤之间传递信息、如何在长程任务中保持目标一致性、如何在遇到错误时触发自我纠错——这些东西不会出现在输出文本里。输出是运算的结果,不是运算的过程。
【推演】如果一个模型的能力增量集中在长程Agent任务上,而这个增量又无法从输出文本中直接复制,那么用“蒸馏”来解释这个增量,在技术逻辑上是不充分的。
四、一个可观测的判断标尺【推演】基于以上分析,可以提炼出一个判断模型能力来源的观测标尺:
如果一个模型的长程Agent能力出现大幅跃迁,而单轮任务提升有限,这个跃迁更可能来自架构层面的改动,而非数据层面的蒸馏。
如果一个模型的能力提升主要表现为输出风格接近某个模型、单轮问答质量提升,而长程任务改善不明显,那么这个提升更可能来自数据层面的改动,蒸馏是可能的解释之一。
这个标尺不是绝对的,但它提供了一个可观测、可验证的分析角度。
五、本文的边界【推演】需要明确以下几点:
第一,本文分析的是能力增量的类型,而非训练数据的来源。本文论证的是“该幅度、该类型的能力跃升,更符合架构革新的特征,不符合蒸馏的能力产出模式”。但技术推论不等于可以100%排除蒸馏参与训练的可能性。它可以否定“整个模型能力来自蒸馏”这种宏大指控,但不能证明训练集中完全没有任何一条外部模型的输出样本。
第二,基准测试本身存在噪声。Terminal-Bench、DeepSWE这类Agent基准,会受后训练、强化学习调优、提示词模板、系统prompt等多种因素影响。除架构之外,大规模强化学习后训练同样可以拉高这类指标。因此本文的表述维持在“该现象更契合架构迭代特征”,而非“只有架构才能实现该提升”。
第三,本文仅讨论“蒸馏复刻模型能力”这一层,不覆盖“请求转发”等其它技术路径。两者是不同的技术问题,需要分别讨论。
六、结语【推演】从V4-Flash-0731到V4.1 Flash,六周时间,长程Agent任务指标出现大幅跃升。这个跃升的路径,更符合架构层面的改动特征,而非数据层面的蒸馏特征。
蒸馏拿到的是结果,不是产生结果的机制。而这次能力增量的核心,恰恰在机制层面。
事实与推演边界声明:
本文中所有标注【事实】的内容,均来自公开基准测试平台数据及官方发布信息。本文中所有标注【推演】的内容,均为作者基于公开数据的逻辑分析,不代表已被证实的客观事实,供读者参考和独立判断。
本文不针对任何特定企业、组织或个人作负面定性,不构成法律、投资或商业建议。如对文中数据或表述有异议,请联系作者更正。