ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

Audiocraft 音频生成终极指南:从零安装到用 MusicGen 创作你的第一首歌

Audiocraft 音频生成终极指南:从零安装到用 MusicGen 创作你的第一首歌 Audiocraft 音频生成终极指南从零安装到用 MusicGen 创作你的第一首歌【免费下载链接】audiocraftAudiocraft is a library for audio processing and generation with deep learning. It features the state-of-the-art EnCodec audio compressor / tokenizer, along with MusicGen, a simple and controllable music generation LM with textual and melodic conditioning.项目地址: https://gitcode.com/gh_mirrors/au/audiocraft你有没有过这样的时刻剪辑视频时想要一段独一无二的背景音乐搜遍素材库却找不到合适的写文章时想配一段轻音效又怕版权问题。如果只敲下一句话比如温暖的木吉他配上舒缓的钢琴就能在几分钟内得到一段完整音频那该多好Audiocraft 音频生成库正是为此而生——它是基于 PyTorch 的深度学习音频生成库集成了文本生成音乐MusicGen、文本生成音效AudioGen等当前最前沿的模型。下面这份指南会带你从零搭建环境、完成安装并用最短的代码创作出第一段属于自己的 AI 音乐。一个想法一句话Audiocraft 能为你做什么简单说Audiocraft 把文字 → 音频这件事做到了开箱即用。它由 MetaFacebook研究院开源核心思路是先用神经音频编解码器 EnCodec 把声音翻译成离散的 Token再用语言模型根据你的文字描述去预测这些 Token最后解码成波形。整个过程你几乎感知不到因为公开 API 只有寥寥几行。你可以用它做的事包括文本生成音乐输入一句风格描述得到完整乐曲旋律约束生成哼一段旋律或给一段参考音频让 AI 顺着旋律续写文本生成音效描述雨滴打在窗户上这类场景生成对应声音音频水印给自己的作品打上不可感知的版权标识。项目的核心模型源码都清晰可查比如音乐生成主入口在 audiocraft/models/musicgen.py音效生成在 audiocraft/models/audiogen.py想深入研究时非常方便。为什么值得选它一库装下主流音频生成全家桶市面上的音频生成方案并不少但很多要么只做单一任务要么依赖多套不同的库和接口。Audiocraft 的差异化价值在于全家桶式的整合模型能力一句话定位MusicGen文本 → 音乐可控的文本生成音乐模型AudioGen文本 → 音效文本生成环境声/人声等EnCodec音频编解码高质量神经音频压缩与分词器Multi Band Diffusion音频解码扩散模型解码器可与 EnCodec 搭配MAGNeT文本 → 音乐/音效非自回归生成速度更快JASCO多条件 → 音乐支持和弦、旋律、鼓点组合控制AudioSeal水印为音频添加版权标识更关键的是它们的调用风格高度统一。学会一个 MusicGen其他模型几乎零成本上手。这一点对新手尤其友好——你不需要为每个模型重新学习一套 API。动手前的地基环境三件套在安装 Audiocraft 之前请先确认三件事它们就像盖楼前的地基Python 3.9 或更高版本——用python --version检查PyTorch 2.1.0CUDA 版本——音频模型本质上是深度学习模型强烈建议使用支持 GPU 的版本。可以用python -c import torch; print(torch.cuda.is_available())快速验证FFmpeg——音频解码与转码的基础工具很多音频文件的读取都依赖它。如果你的 Python 版本偏旧推荐先用虚拟环境隔离python -m venv audiocraft_env source audiocraft_env/bin/activate然后安装 PyTorch 基础环境若已装过可跳过python -m pip install torch2.1.0 torchaudio torchvision接着安装构建工具与 FFmpegpython -m pip install setuptools wheel sudo apt-get install ffmpeg # Ubuntu/Debian 系统 # 如果使用 Anaconda也可以用conda install ffmpeg5 -c conda-forge 提示FFmpeg 装好后再安装 Audiocraft可以避免后续音频读写时出现莫名其妙的格式错误。三种安装方式选最省心的那一种环境就绪后根据你的目标选择安装方式方式一直接安装稳定版最快python -m pip install -U audiocraft适合只想快速体验生成效果的场景。方式二从源码安装训练模型的必经之路git clone https://gitcode.com/gh_mirrors/au/audiocraft cd audiocraft python -m pip install -e .-e表示以可编辑模式安装代码改动即时生效官方明确要求训练时必须采用这种方式。方式三附带水印功能可选python -m pip install -e .[wm]需要训练或使用音频水印模型AudioSeal时再选这个。安装完成后用一段代码验证安装是否成功import torch import audiocraft print(PyTorch:, torch.__version__, | CUDA 可用:, torch.cuda.is_available()) print(Audiocraft 版本:, audiocraft.__version__)三分钟快速上手生成你的第一段 AI 音乐安装就绪现在进入最激动人心的环节——用 MusicGen 创作第一段音乐。打开你的 Python 环境输入from audiocraft.models import MusicGen # 加载预训练模型首次运行会自动下载权重稍等片刻 model MusicGen.get_pretrained(facebook/musicgen-small) # 设置生成参数输出 10 秒音频 model.set_generation_params(duration10) # 输入文字描述一次生成多条 descriptions [欢快的电子舞曲节奏感强烈, 宁静的钢琴独奏伴着雨声] wav model.generate(descriptions)运行完成后wav里就是两段对应的音频张量。接下来把它保存成文件from audiocraft.data.audio import audio_write for idx, one_wav in enumerate(wav): # 自动做响度归一化-14 LUFS并保存为 wav 文件 audio_write(fmy_music_{idx}, one_wav.cpu(), model.sample_rate, strategyloudness, loudness_compressorTrue)去当前目录找找my_music_0.wav和my_music_1.wav播放听听——这就是你创作的第一段 AI 音乐玩得更花让音乐跟随你的旋律纯文本生成已经够神奇但 MusicGen 的旋律约束功能更能体现它的可控性。假设你有一小段哼唱或一段参考旋律想让 AI 基于它续写完整配乐只需要import torchaudio # 读取一段参考音频项目 assets 目录自带示例如 bach.mp3 melody, sr torchaudio.load(assets/bach.mp3) # 让 AI 在保持原旋律走向的同时按描述生成音乐 wav model.generate_with_chroma(descriptions, melody[None].expand(len(descriptions), -1, -1), sr)generate_with_chroma会提取参考音频的旋律特征Chroma作为生成的约束条件。你可以试试用同一段旋律配上爵士版摇滚版等不同描述感受 AI 如何在约束与创意之间找到平衡。 想体验更强条件控制JASCO 模型支持同时指定和弦、鼓点和旋律配置参考 config/conditioner/ 目录下的 jasco 相关配置文件。从音乐到音效AudioGen 与更多玩法除了音乐Audiocraft 还能生成音效这就是 AudioGen 的用武之地。它的用法几乎和 MusicGen 一模一样from audiocraft.models import AudioGen model AudioGen.get_pretrained(facebook/audiogen-medium) model.set_generation_params(duration5) wav model.generate([小狗在公园里叫远处传来鸟鸣还有风声])给游戏做素材、给视频配环境音、给播客加转场音效……AudioGen 都能派上用场。更妙的是因为两套 API 统一你可以很自然地在同一个项目里音乐 音效混搭使用。进阶之路本地 Demo 与自定义训练光看代码不过瘾项目自带基于 Gradio 的图形界面 Demo一条命令即可启动像玩网页应用一样体验全部模型能力python -m demos.musicgen_app --share另外 demos/ 目录下还有magnet_app.py、jasco_app.py等更多示例应用以及对新手友好的 Jupyter Notebook如 demos/musicgen_demo.ipynb。如果你已经准备好训练自己的模型项目也提供了完整的训练管线训练框架与求解器逻辑位于 audiocraft/solvers/所有配置采用 Hydra 管理集中在 config/ 目录包括模型结构config/model/、数据集config/dset/和训练求解器config/solver/三大部分训练相关细节请查阅官方训练文档 docs/TRAINING.md。需要提醒的是训练对硬件要求较高建议先熟悉生成流程再逐步进入训练环节。新手避坑指南五个高频问题一次讲清① CUDA 不可用怎么办先确认安装的是 CUDA 版 PyTorchtorch.cuda.is_available()必须返回True。安装时建议用pip install torch2.1.0这类带版本号的命令避免装到与 CUDA 不匹配的版本。② 显存不够用生成音乐本质上是跑大模型。官方建议使用至少 16GB 显存的 GPU 跑中等模型约 15 亿参数如果你的显卡较小优先选facebook/musicgen-small3 亿参数并缩短duration仍然可以获得不错的效果。③ 依赖版本冲突项目对依赖有明确锁定torch2.1.0、xformers0.0.23、numpy2.0.0、torchaudio2.1.2。若遇到冲突检查并调整这些包的版本即可。强烈建议全程使用虚拟环境避免污染系统 Python。④ 模型下载太慢或想换缓存目录模型权重默认从 Hugging Face 下载可通过环境变量AUDIOCRAFT_CACHE_DIR指定缓存位置方便统一管理已下载的权重。⑤ 商用版权问题代码采用 MIT 许可但预训练模型权重采用 CC-BY-NC 4.0 许可即免费但仅限非商业用途。有商用需求时务必阅读项目根目录的LICENSE_weights文件确认条款。现在轮到你动手了从一句文字描述到一段完整音频Audiocraft 把过去需要大量专业知识的音频制作流程压缩成了十几行 Python 代码。你不需要懂声学原理也不必掌握复杂的深度学习知识只需要一个想法、一台带 GPU 的电脑和一点点好奇心。现在就动手吧安装环境、跑通上面的示例然后试着用一句话描述你脑海中的声音。也许下一首让你单曲循环的音乐就诞生在你的键盘之下。想深入探索可以从项目内的 docs/ 目录开始那里有 MusicGen、AudioGen、MAGNeT 等每个模型的专题文档祝创作愉快【免费下载链接】audiocraftAudiocraft is a library for audio processing and generation with deep learning. It features the state-of-the-art EnCodec audio compressor / tokenizer, along with MusicGen, a simple and controllable music generation LM with textual and melodic conditioning.项目地址: https://gitcode.com/gh_mirrors/au/audiocraft创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表