微软推出实时语音转录流式模型
微软(MSFT)推出MAI-Transcribe-2-Streaming,一款面向实时转录场景的低延迟语音识别模型,目前处于公开预览阶段。该模型接受连续音频流输入,在说话过程中即返回增量转写结果:中间结果持续更新当前文本,最终结果逐段确认,适用于呼叫中心、语音助手、会议与课堂字幕、语音交互界面以及实时记录等场景。
接入方式有两种,一是兼容OpenAI Realtime的WebSocket实时API,二是托管的Azure Speech SDK。官方公布的定价为每小时0.54美元。

