中国公司 DeepSeek 发布了其模型 DeepSeek-V4-Flash-0731 的更新版本,表明人工智能性能的进一步提升未必需要依赖更大的模型。该新版本在架构和规模保持不变的情况下,通过新的后训练显著增强了能力,并在独立测试中超越了较大的 DeepSeek-V4-Pro 模型。
DeepSeek-V4-Flash-0731 基于四月份发布的 V4-Flash 预览版推出。根据官方文档,该公司保留了模型的架构和规模不变,主要进行了基础训练后的微调调整。正是这一步骤带来了能力的显著提升,显示出在当今时代,除了参数量之外,后训练方法也扮演着至关重要的角色。
该模型采用 Mixture-of-Experts (MoE) 架构,在生成每个 token 时仅激活部分参数。DeepSeek 发布的官方检查点(checkpoint)计入推测解码模块后约有 3040 亿个参数。此外,该模型也作为开放权重解决方案通过 Hugging Face 平台提供。
其中最显著的特性之一是极其长的上下文支持能力。DeepSeek 表示其输入端可支持高达 一百万个 token,输出最大长度为 38.4 万个 token。该模型同时支持推理模式和普通模式、工具调用等功能,这些功能对于创建更自主的 AI Agent(智能体)至关重要。
小模型超越大兄弟
独立机构 Artificial Analysis 发布的测试结果是该次更新中最引人注目的部分之一。DeepSeek-V4-Flash-0731 在最大推理模式下获得了 50 分的人工智能指数 (Artificial Analysis Intelligence Index)得分,使其跻身当前最强大的模型之列;评估者指出其性能也显著优于之前的 V4-Flash 版本。
根据测试结果显示,更新后的 Flash 版本甚至超越了较大的 DeepSeek-V4-Pro。这一点尤其重要地体现了效率问题:人工智能的发展正逐渐从“如何构建最大的模型”转向“如何在有限的计算资源下获得最高的智能水平”。
DeepSeek 还通过价格优势对竞争对手施加压力。Artificial Analysis 报告称,其 API 定价约为 每百万输入 token 0.14 美元和每百万输出 token 0.28 美元。在包含缓存使用的综合场景下,运营成本远低于许多竞争模型。
正是这种性能与价格的平衡,使得 DeepSeek-V4-Flash-0731 进入了 Artificial Analysis 所谓的 Pareto frontier(帕累托前沿)——即在这些指标中无法找到同时更智能且更便宜的替代方案的模型区间。
长上下文与更快的生成速度
该模型的另一个重要组成部分是对长上下文的优化处理。V4 系列架构采用了减少大规模输入所需计算量和内存消耗的机制。这对于处理大型文档、数据库、长时间对话或自主任务(其中模型逐步积累大量信息)至关重要。
发布的版本还包含了推测解码技术。较小的辅助模块会预先预测接下来的几个 token,主模型随后并行验证这些预测。结果是实现了更快的生成速度,而无需对基础模型进行重大修改。Hugging Face 记录该发布版本的检查点大小约为 3040 亿个参数。
人工分析测得该模型每秒可输出超过百个 token,将其归入此类性能级别的快速推理模型行列。
竞争焦点从规模转向效率
DeepSeek-V4-Flash-0731 展现了生成式人工智能行业中日益凸显的广泛趋势。开发者们不再仅仅比拼最大模型的绝对性能,而是更关注每美元能带来多少智能以及所需的硬件门槛如何。
这对 AI 代理尤为重要。在长期处理任务时,它们可能在文档处理、编程、客户服务或企业数据库操作中消耗数百万个 token。因此,即使单个百万 token 的成本仅有相对较小的差异,但在大规模部署时也意味着显著的运营成本差别。
此外,DeepSeek 还拥有模型权重可获取的另一项优势。企业不必完全依赖云端 API,而可将模型部署于自有基础设施上,这对于需要确保敏感数据保留在组织内部的情况尤为有利。DeepSeek 已在 Hugging Face 平台上发布了其 V4 系列中的该模型。
V4-Flash 的更新不仅意味着基准测试表格上的又一次进步,更表明更好的训练和优化所带来的效果往往优于单纯增加参数量。正是高性能、高速度、长上下文窗口、开放权重以及低成本这一组合,对于 AI 市场的未来发展可能比争夺最大模型更为重要。