长期使用多模型 API 做视频脚本、网页调研、AI 动画生成等批量任务后,能直观感受到 DeepSeek V4 Flash 系列输出内容冗余严重:
个人场景实测佐证日常 AI 动画制作、行业成本调研任务中,小米 MiMo V2.5、DeepSeek Mini MAX 均不会触达单次输出上限;切换至 V4 Flash 后,单轮任务 4 次触发输出截断提示,需要手动接续生成。单一份行业成本调研任务,DeepSeek 消耗 Token 总量接近 1 亿,同逻辑任务 MiMo 仅需约 1/3 量级 Token 即可完成。
算力资源价值分层:AGI 是西瓜,冗余推理是芝麻梁文锋明确提出,公司核心唯一主线是通用人工智能 AGI,Agent、对话 API 只是落地载体。当前大量算力被消耗在生成无价值的冗余文本上,同等算力如果投入模型预训练、思维链、多轮智能体能力迭代,能产生更高长期价值。涨价通过价格杠杆抑制无节制批量调用,释放宝贵 GPU、HBM 算力资源转向研发。
行业客观成本压力叠加外部环境进一步加剧成本矛盾:2026 年高端 AI 芯片、HBM 内存价格持续上涨,GPU 服务器租金同比涨幅超 40%;国内 API 调用需求爆发,日均 Token 调用量较 2024 年初增长千倍,算力供给跟不上爆炸式增长的用户需求,腾讯云等云厂商同期也连续上调 AI 算力定价。长期低价模式下,调用量越高亏损越多,商业化可持续性不足。