智谱正式推出并开放GLM-5.3-FlashX,API已同步上线,ModelKey为GLM-5.3-FlashX。该模型主打推理速度,最高可达每秒200 tokens,据报道其推理服务运行在约10万张国产加速卡上。在国产算力供给趋紧的背景下,用国产芯片跑出高吞吐的轻量级模型,被视为智谱降低推理成本、争夺开发者的关键一步。