ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

5分钟快速上手 video-analyzer:AI 视频分析自动生成文字描述

5分钟快速上手 video-analyzer:AI 视频分析自动生成文字描述 5分钟快速上手 video-analyzerAI 视频分析自动生成文字描述【免费下载链接】video-analyzerAnalyze videos using LLMs, Computer Vision and Automatic Speech Recognition项目地址: https://gitcode.com/gh_mirrors/vi/video-analyzer手头攒了一堆会议录像、课程视频想看某个时间点发生了什么只能拖进度条一帧帧翻。video-analyzer 解决的就是这个问题你丢一个视频进去它还你一份带时间线的文字描述画面内容 语音内容都有看完文字就知道视频讲了什么。能力速览视频变文字多模态融合视觉模型看画面Whisper 听声音两边结果按时间线拼成一段连贯的描述。不用你一边看视频一边做笔记描述里直接说清谁在什么时候做了什么、说了什么。完全本地也能跑接上 Ollama 和本地视觉模型后视频不出你的机器。处理内部会议、未公开内容时这一点比速度更重要。不想折腾硬件也能用同一套命令换--client openai_api就能走云端 API本地机器只有 8GB 内存的人也能分析长视频。装完就能跑环境要求一句话Python 3.11 和 FFmpeg音频处理用本地跑模型的话建议 16GB 内存起步。git clone https://gitcode.com/gh_mirrors/vi/video-analyzer cd video-analyzer python3 -m venv .venv source .venv/bin/activate pip install .装 FFmpeg 就一条命令sudo apt install ffmpegmacOS 用brew install ffmpeg。本地跑还需要 Ollama 拉一个视觉模型ollama pull llama3.2-vision # 拉模型 ollama serve # 起服务如果还没起第一次运行把路径换成你自己的视频video-analyzer meeting.mp4跑完在output/目录下拿analysis.json里面是元信息、逐帧分析和最终描述。更多参数说明看 docs/USAGES.md完整输出样例在 docs/sample_analysis.json。典型场景一段会议录像变成纪要底稿输入一段 40 分钟的周会录像里面有讨论、有屏幕共享、有结论。操作你只关心会上定了哪些事就带上一个提示词跑video-analyzer meeting.mp4 --prompt 提取会议核心决策和行动计划--prompt做的事很简单把你这句话作为问题塞给视觉模型让它分析时围绕它组织内容而不是泛泛描述画面。输出output/analysis.json里分三块——transcript是带时间戳的完整转录文本frame_analyses是逐帧描述每帧含场景、动作、与前一帧的衔接点最后的视频描述把两者按时间线合成类似00:05 主讲人打开白板讲解系统组件02:30 切到演示界面……。你拿这份东西当纪要底稿人只需要校对不用从零听写。参数怎么调按需求对号入座不用背全量参数你的需求是建议加说明长视频先试跑一段--duration 300只处理前 5 分钟跑太慢、内存吃紧--max-frames 30全片均匀采样 30 帧而不是取前 30 帧描述偏离你想要的重点--prompt 你的问题让模型围绕你的问题组织描述语音识别把语种认错了--language zh跳过自动检测直接指定语言转录质量不够--whisper-model large模型越大越准也越慢越吃资源中途断了想接着跑--start-stage 2跳过提取阶段从逐帧分析开始配置文件的优先级是命令行参数 config/config.json 内置默认值。想固化一套方案就写config/config.json单次实验用命令行覆盖即可结构说明在 docs/USAGES.md。本地跑还是上云本地Ollama llama3.2-vision适合隐私敏感内容、不想付 API 钱、且机器有 16GB 以上内存有 12GB 显存的 GPU 更稳。代价是慢逐帧分析是串行的长视频要等。云端任意 OpenAI 兼容 API适合视频量大、机器配置一般、赶时间的场景。代价是视频帧会上传到对方服务敏感内容别走这条路OpenRouter 上有些免费视觉模型可以当零成本备选。一条命令切过去video-analyzer meeting.mp4 --client openai_api --api-key sk-xxx --api-url https://api.openai.com/v1 --model gpt-4o避坑速查现象运行后报错连不上 LLM / 提示找不到模型。原因Ollama 服务没起或者llama3.2-vision还没拉下来。解法确认ollama serve在运行先ollama pull llama3.2-vision再重跑。现象长视频跑很久还没完甚至内存爆了。原因默认帧提取密度和 Whisper medium 模型都是稳妥档长视频会放大开销。解法加--max-frames 30 --whisper-model small或者先--duration 600只跑前 10 分钟验证效果。现象转录文本错乱但看视频口齿很清楚。原因自动语言检测在短音频或口音重的情况下会认错语种。解法加--language指定语言必要时升--whisper-model large。原理一句话视频进来拆成两路抽关键帧给视觉模型逐帧描述音轨丢给 Whisper 转成带时间戳的文字两路结果按时间线合并交给 LLM 合成最终描述落成analysis.json。回到开头那堆录像先挑最短的一段跑video-analyzer打开analysis.json看看描述和你的预期差多远。差得多的话再回头调--prompt和帧数比一开始就把参数研究透要快。【免费下载链接】video-analyzerAnalyze videos using LLMs, Computer Vision and Automatic Speech Recognition项目地址: https://gitcode.com/gh_mirrors/vi/video-analyzer创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表