Google 于周二推出了 Gemini 3.5 Transcribe。这款语音转文本模型可以去除语气词,尊重用户提供的词汇表,并在单次录音中标记多达三位发言者。通过在无需人工编辑的情况下将原始音频转换为精炼、结构化的文本,该服务缩短了开发人员为会议记录、法律文件等清理转录文本所需的时间。

为什么 Google 选择在此时推出

Google 的音频处理技术栈多年来一直在不断演进,但其早期的产品 Chirp 3 在处理停顿、专业术语和发言者切换时仍会出错。远程办公和播客的兴起扩大了转录市场,但许多企业仍依赖于人工后期处理或价格昂贵的细分领域供应商。Gemini 3.5 Transcribe 解决了这一痛点:它不仅能识别语音,还能进行即时编辑。

新模型究竟能做什么

  • 自动去除语气词 —— “um”、“uh”及类似的语流不畅词会在生成转录文本时消失,从而提供更整洁的阅读体验。
  • 自定义词汇表 —— 用户可以上传特定领域的词汇列表,防止模型将其“纠正”为通用术语。这对于充斥着缩写、产品名称或外语拼写的领域至关重要。
  • 发言者归属 —— 系统可以识别多达三个不同的声音,为每段话分配发言者标签,并添加词级时间戳。法律团队、医疗速记员和记者可以直接从源文件中生成带有时间码的记录。
  • 多语言覆盖 —— Google 声称在 85 多种语言中的准确度有所提高,较其前代产品的较窄语言范围有了显著提升。

所有这些功能都通过面向开发人员的 API 提供。应用程序请求转录文本,并接收一个已经包含清理后的文本、发言者标签和时间戳的 JSON 负载。

更广泛的 Gemini 音频布局

Gemini 3.5 Transcribe 属于更广泛的音频模型家族:

  • Gemini 3.5 Live —— 针对实时交互进行了优化,处理句中中断的能力优于早期的实时模型。
  • Gemini 3.5 Live Experimental —— 一种更高层级的推理变体,在解决复杂任务时能够叙述其逐步思考的过程。

这两种实时模型目前在 macOS 的 Gemini 应用上以及部分地区的 Android 版 Rambler 听写功能中提供英文版本。

谁将从中受益

开发人员可以将“边说边清理”的工作流嵌入到协作工具、内容创作平台和语音驱动的助手当中。企业可以生成即时发布的转录文本,从而减少对按分钟计费并附带严格数据处理条款的第三方服务的依赖。内容创作者可以发布精炼的字幕,无需单独的编辑环节,从而加快视频和播客的制作周期。

谁可能会受到冲击

对于那些针对发言者识别(diarization)和术语处理收取高额费用的专业转录供应商来说,需求可能会下降,尤其是在对成本敏感的初创公司中。该模型对三位发言者的限制也可能促使大型机构转向支持单次通话中更多参与者的专用解决方案。

局限性与悬而未决的问题

  • 发言者数量 —— 每个文件只能区分三位发言者;参与人数较多的会议仍需借助外部工具。
  • 语言推广 —— 虽然宣布了多语言支持,但实时模型目前仍仅限英文,非英语用户仍需等待完整功能的上线。
  • 隐私 —— 与任何基于云的语音服务一样,企业必须在 Google 基础设施带来的便利性与避免将敏感音频上传至外部服务器的需求之间进行权衡。Google 的条款允许某些客户进行本地部署,但该选项尚未公开。

后续关注点

Google 已暗示未来的更新将提高发言者数量上限,并将实时模型的语言覆盖范围扩展到更多语言。关注 API 的定价层级也至关重要;对于高频用户而言,高昂的按分钟计费成本可能会抵消其带来的生产力提升。最后,开发人员的采用曲线将揭示自动去除语气词带来的便利性是否足以抵消在特定领域词汇中可能出现的残余错误。

核心结论: Gemini 3.5 Transcribe 将润色语音录音这一繁琐的任务简化为一次 API 调用,为开发者提供了一个现成的工具,用于获取整洁且带有说话人标签的文本。其成功取决于 Google 扩大语言支持、提高说话人数量限制以及解决企业隐私顾虑的速度。