Google发布Gemini 3.5 Transcribe,一款面向实时语音交互和录音处理的语音转文字模型。该模型已通过Gemini API与Gemini Enterprise Agent Platform以公开预览方式提供。

Google在8月26日的官方公告中介绍,开发者可通过两类接口接入:实时场景使用Live API中的gemini-3.5-transcribe-live,用于持续双向流式转写;处理会议录音、通话记录等预录音频时,则可使用Interactions API中的gemini-3.5-transcribe,获得说话人归属和词级时间戳。

功能层面,Google称模型可处理口语中的自我修正和语气词,并自动整理文本格式;同时支持自定义词汇、85种以上语言的自动识别与转写。对于预录音频,官方称其最多可标记三位说话人,超过三人的能力仍属实验性支持。

Google援引Artificial Analysis的测量数据称,该模型在流式和非流式场景下的平均词错率分别为4.0%和2.6%。这些指标来自官方所述的第三方测量,实际准确度仍会随语言、背景噪声、领域术语和音频质量而变化。

此次更新反映出语音模型正从“把声音写下来”转向更适合应用集成的输入层:实时交互、结构化时间信息和术语控制可减少后续处理环节。不过,在医疗、法律、财务或正式记录等高风险用途中,转写结果仍应由人工复核。

消息来源:Google官方博客《Intelligent transcription with Gemini 3.5 Transcribe》,2026年8月26日。来源链接:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-5-transcribe/