AI 实战:用 Gemini 3.5 Transcribe 做跟读评分,让 Song Lingo 听你念歌词
来源:dev.to — 2026-09-29
📋 概述
这是 Song Lingo 系列的第三篇。第一篇用 Gemini 3.8 Flash TTS 把 YouTube MV 链接变成带假名、翻译、语法讲解和逐句示范的日语学习应用,第二篇把它部署到 Cloud Run 并用 IAP 锁成只有自己能用的私有页面。这次做的是路线图上的第二项:跟读评分。作者的痛点是——老师示范了,但他从不知道自己念得对不对;听十遍示范,不如自己念一遍然后被告知错在哪里。文章介绍 8 月 26 日发布的 Gemini 3.5 Transcribe:两个面向语音转文字的模型,一个处理录音文件,一个通过 Live API WebSocket 实时转写。
🔑 核心要点
- 模型能力包括 85 种以上语言、词级时间戳、说话人分离、最多 1000 个自定义词汇。
- 两种模式分别是 smart(处理自我纠正、去口头语、自动排版)与 verbatim(逐字转写)。
- 官方引用 Artificial Analysis 的数据:整段转写平均词错率 2.6%,流式 4.0%,比上一代 Chirp 3 快 70% 拿到最终结果。
- 两个实测教训:首次授权弹窗最容易让用户乱点,要提前把能力边界写在界面上;测试环境卡住时别硬扛,换掉卡住的那一段让其余部分真跑。
💡 金句
听老师示范十遍,不如自己念一遍,然后被告知错在哪里。
👍 0
👎 0
← 返回 dev.to 首页