小米MiMo-V2.5公开推理优化 API最高降价99%
小米正式披露MiMo-V2.5系列模型推理系统全链路优化方案。团队围绕Hybrid SWA+MoE+多模态复合架构,系统性重构了KVCache管理、分级缓存、前缀缓存到调度策略与Prefill/Decode链路的完整推理栈,KVCache存储压缩至同级方案的约1/7,长序列推理成本大幅下降。
基于此,5月27日MiMo-V2.5系列API完成永久降价,最高降幅达99%(缓存命中输入),不区分输入长度,Max套餐$100可获82B token,较此前1.6B提升约5-8倍。MiMo团队负责人罗福莉(DeepSeek-V2核心开发者之一)在X透露,按当前价格自家生产推理引擎接近满载仍能基本盈亏平衡。
此举与DeepSeek V4-Pro永久降价相呼应,使中国前沿模型与GPT-5.5、Claude Opus 4.7等美国主力模型价差进一步拉大至15-30倍。
来源:Yahoo Tech

