文本生成猫叫模型:AI 猫咪的表现力范围有多大
来源: kmjn.org
概述
作者把程序化内容生成社区用来分析关卡生成器广度的「表现力范围」方法,用到了猫叫声上:3 个文本到音频模型、7 个提示词、每个组合 100 个样本,一共生成了 2100 段猫叫。用音色、音高、响度做特征向量再 PCA 降维之后,不同模型的输出范围与聚类结构就能被画出来,而且可以直接点开听。
核心要点
- 文本到音频模型并非对所有类型的声音都同样擅长,输出「广度」也不一样:有的模型能给出很多种雷声,鸟叫却很少,反之亦然。
- 作者与合著者提出用表现力范围图做探索性分析,这套可视化工具原本来自程序化内容生成(PCG)社区,用于分析关卡生成器的多样性。
- 实验选了三套架构与训练集都不同的模型:Stable Audio Open 1.0、EzAudio 和 TangoFlux,提示词沿用论文里的「sound of [x]」格式。
- 因为不想为每个提示手工设计指标,他们统一用音色、音高、响度及其一二阶差分做特征,再 PCA 降到两维;坐标轴不可直接解释,但点的邻近关系仍有意义。
- 与论文版不同,网页版可以点击数据点直接播放生成的音频,作者也提醒养猫的人最好戴耳机。
金句
任何一个文本到音频模型,很可能都不是对所有类型的声音都同样擅长。
👍 0
👎 0
← 返回 Lobsters 首页