谷歌发布Gemini 3.5语音转录模型
谷歌发布新一代语音转文本模型Gemini 3.5 Transcribe。与传统ASR逐字照搬录音不同,它在转录阶段就理解说话人的意图,自动剔除「嗯」「呃」这类语气词、口头重复和自我更正,直接输出接近书面语、可以拿来就用的文本。
该模型目前的落地场景是Gboard输入法中的Rambler语音输入:用户可以像平时说话一样连续口述,哪怕中途改口、绕圈子,系统也会整理成条理清晰的段落。这项能力率先在Pixel 11上开放,后续将接入Chrome浏览器,把「说话即成稿」的体验从手机键盘扩展到桌面端网页输入。
对经常需要写邮件、做会议记录、整理面试或课堂笔记的人来说,转录环节少一道人工清洗,意味着从口述到成稿的链条被明显缩短。这也是谷歌把Gemini能力下沉到输入法、浏览器等日常入口的又一步——不再依赖用户主动打开AI应用,而是把模型直接嵌进已有的使用习惯里。
来源:The Verge
地里匿名用户Z7RCL
写小说的人爽了,口述就可以了

