谷歌正式发布开源多模态模型Gemma 4 12B,采用全新「无编码器」(encoder-free)统一架构,将图像、音频等多模态数据直接输入大模型主干,从而降低多模态处理延迟。它是Gemma系列首个支持原生音频输入的中型模型,体积足够小,可在配备16GB显存或统一内存的GPU笔记本上本地运行。谷歌同时首次推出可下载的macOS桌面应用,让开发者直接在消费级设备上体验完全本地化的语音与视觉交互。