GitHub 雷达
首次出现 67 天前

suno-ai/bark

Bark 是 Suno 开源的一个基于 Transformer 架构的文本到音频生成模型,能够根据文本提示生成高度逼真的多语言语音、音乐、背景噪音和简单音效,甚至包括笑声、叹息和哭泣等非语言表达。它主要使用 Jupyter Notebook 和 Python 实现,通过预训练模型检查点直接进行推理,支持自动识别输入文本语言并生成对应口音。该模型的亮点是支持多语言和多种音频类型生成,已获得 MIT 许可可用于商业用途,并提供低显存 GPU 运行选项和社区语音提示库,适合研究、创意音频制作和需要快速生成多样化音频的场景。

近 7 日
+7
累计 Star
39.3k
Fork
4,668
近 30 日
+29
Star 趋势 · 50 个采集点
+0%
7 月 28 日9 月 21 日
语言Jupyter Notebook
分类AI/机器学习
最近提交8 月 19 日
创建时间4 月 8 日
首次收录7 月 28 日 · 自动扫描
README 摘要
Bark 是 Suno 开源的一个基于 Transformer 架构的文本到音频生成模型,能够根据文本提示生成高度逼真的多语言语音、音乐、背景噪音和简单音效,甚至包括笑声、叹息和哭泣等非语言表达。它主要使用 Jupyter Notebook 和 Python 实现,通过预训练模型检查点直接进行推理,支持自动识别输入文本语言并生成对应口音。该模型的亮点是支持多语言和多种音频类型生成,已获得 MIT 许可可用于商业用途,并提供低显存 GPU 运行选项和社区语音提示库,适合研究、创意音频制作和需要快速生成多样化音频的场景。
中文摘要由 AI 生成,仅供参考。
在 GitHub 打开