DeepSeek于9月10日正式发布V4.1 Flash模型,此前该模型已开放限时测试。这是其全新模型结构系列中尺寸最小的一款,原生具备多模态视觉理解能力。新架构大幅压缩了KV Cache,与上一代相比对HBM的需求降至约四分之一、对SSD的需求降至约八分之一。由于Agent类任务中缓存命中费用往往占成本大头,这一压缩直接拉低了智能体应用的调用成本。