ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

SadTalker 快速上手:一张照片+一段音频,生成会说话的数字人视频

SadTalker 快速上手:一张照片+一段音频,生成会说话的数字人视频 SadTalker 快速上手一张照片一段音频生成会说话的数字人视频【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker丢给系统一张人物照片和一段 10 秒的旁白音频几分钟之后你能拿到的是一段嘴唇跟着音频开合、头部还会轻微晃动的数字人视频——这就是 SadTalkerCVPR 2023 论文项目交付的效果。它的核心是音频驱动人脸动画先用网络从音频里学出 3D 运动系数再把这些系数渲染回原图油画、动漫、照片等艺术风格都能原样保留。做课程视频、虚拟角色、个人祝福短片的人基本都能直接用上。 先看效果4 类场景实测课程与教程视频。把课件里那张油画质感的人物图配上讲解音频生成结果里笔触和色调一点没丢动的只有脸。旧插画素材不用重做直接转成会讲解的视频。虚拟角色与主播。静态立绘配--ref_eyeblink参数再指定一段自然眨眼的参考视频角色就不再是死鱼眼盯着镜头眼神活度上一个台阶。企业演示与半身照。半身人像走默认的 crop 预处理系统自动框出脸部区域做动画头部动作最自然适合产品宣讲、培训开场这类需要正脸出镜的场合。个性化祝福。老照片往往偏糊加--enhancer gfpgan做人脸增强后再合成五官清晰度明显提升发给亲友做生日或节日视频正合适。 一次装好从克隆到启动的 5 条命令硬件门槛不高Python 3.8 以上8GB 内存起步有 CUDA 显卡最好纯 CPU 也能跑只是慢另外系统里必须有 ffmpeg后面合成视频靠它。git clone https://gitcode.com/GitHub_Trending/sa/SadTalker cd SadTalker pip install -r requirements.txt bash scripts/download_models.sh python app_sadtalker.py第一条把代码拉下来第二条进目录第三条装全部 Python 依赖第四条把推理所需的几个权重文件下到checkpoints/同时会拉取 gfpgan 增强模型最后一条启动 Gradio 界面浏览器打开 http://localhost:7860 就能传图传音频出片。Windows 用户嫌步骤多可以直接双击webui.batmacOS 和 Linux 跑bash webui.sh两个脚本都会自动建虚拟环境并替你装依赖。️ 调参手册预处理模式与核心开关输入图片先过一道预处理--preprocess一共 5 个档位按图片类型选模式适用场景特点crop全身/半身人像自动框出脸部做动画头部动作最自然extcrop脸部被头发、肩膀挡住裁切范围更大避免切到五官resize证件照式大头照整图缩放脸部占满画幅full需要保留完整人物的画作只动脸部其余区域贴回原图extfullfull 模式下脸太小先把脸部区域扩出来再处理效果更好常用开关如下命令行直接传WebUI 里也有对应选项--expression_scale表情幅度默认 1.0建议 0.5–1.5超过 1.5 容易显得夸张--still固定原始头部姿态需要镜头角度的场合比如产品页循环播放加上它--enhancer人脸超分填gfpgan或RestoreFormer提升输出清晰度--ref_eyeblink/--ref_pose分别借用参考视频的眨眼和头部动作让人物更有生命--size输出脸部分辨率显存紧张选 256追求细节选 512--batch_size默认 2显存不够时降到 1。一条典型的完整命令长这样python inference.py --source_image examples/source_image/art_0.png \ --driven_audio examples/driven_audio/chinese_news.wav \ --expression_scale 1.2 --enhancer gfpgan 遇到问题先查这里Q提示 ffmpeg 未找到或不是内部命令Linux 用包管理器装如conda install ffmpeg或 aptmacOS 跑brew install ffmpegWindows 装完后确认已加入 PATH。Q报错 unexpected EOF怀疑模型文件损坏是下载中断导致的。重跑bash scripts/download_models.sh装完抽查checkpoints/里文件大小是否与官方发布一致。Q口型和音频对不上先把音频转成 16kHz 的 wav 再试仍不理想就微调--expression_scale画面模糊时把--size提到 512。QCUDA out of memory--size降到 256、--batch_size降到 1或运行前设PYTORCH_CUDA_ALLOC_CONFmax_split_size_mb:128再启动。Q音频格式不被接受只支持 wav 和 mp3其他格式先用 ffmpeg 转成 wav。QMac M1 上 dlib 相关报错单独执行pip install dlib重装一次即可。 继续深挖的入口核心源码src/facerender/ 面部渲染引擎、src/audio2exp_models/ 音频到表情系数的网络、src/face3d/ 3D 人脸建模配置与工具src/config/ 各阶段的 yaml 配置官方文档docs/install.md 安装细节、docs/best_practice.md 效果优化经验、docs/FAQ.md 问题清单示例资源examples/driven_audio/ 中文/英文/日语音频、examples/source_image/ 各风格人物图、examples/ref_video/ 眨眼与姿态参考视频写在最后第一次跑建议保持 256 分辨率 crop 模式拿 10 秒左右的音频出一版确认口型和头部动作没问题再开 512 enhancer 出成片——顺序反了会在废片上浪费不少显存。每试一组参数就记一行参数 → 效果几轮之后你就有自己的配方表了。【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表