详细介绍
产品定位
VideoUse 是 Browser Use 团队开源的 AI 视频剪辑 Agent,项目位于 GitHub 的 browser-use/video-use,采用 MIT 协议,由 Python 编写,已获 2.6 万 Star,并曾登上 GitHub 日榜 TOP5。它的核心理念是用自然语言对话替代传统时间线操作:用户只需把原始素材放进文件夹,然后对 Claude Code、Codex 等具备 shell 权限的编程智能体说一句话,就能直接拿回 final.mp4。它瞄准的是降低视频粗剪门槛,让剪辑流程从手动拖拽时间线转向可对话、可追踪、可自动执行的 Agent 工作流。
核心功能
智能剪辑可自动识别并剪掉嗯啊等填充词、口误、重复句以及片段间死寂;自动调色内置 warm_cinematic 暖调电影感与 neutral_punch 中性增强预设,也支持自定义 ffmpeg 滤镜链;每个剪切点会自动添加 30ms 淡入淡出以消除爆音;字幕烧录默认采用两词大写短视频风格,字体、颜色和位置可定制;动画叠加可通过 HyperFrames、Remotion、Manim 或 PIL 生成,并由并行子智能体分别处理;剪辑进度保存在 project.md 中实现会话记忆;渲染后还会自我评估,检查每个剪切点的跳帧、爆音和字幕遮挡,最多修复 3 次。
技术特点
最反直觉的设计是 LLM 自始至终不看视频画面,而是读视频,只处理文本、时间轴和结构化剪辑决策,这与 browser-use 不给 AI 看网页截图而是读结构化 DOM 的思路一脉相承。它采用双层读取系统:音频转录层通过 ElevenLabs Scribe 生成逐词级时间戳、说话人分离和音频事件标记,把全部素材打包成约 12KB 的 takes_packed.md 作为 LLM 主要阅读视图;可视化复合层按需生成,仅在判断沉默、节奏差异时调用 timeline_view 生成胶片条加波形加词标签的合成 PNG。这样把传统方法需传给 AI 的约 30000 帧、4500 万 token 压缩到 12KB 文本加几张关键图片。整体流程为转写视频、打包数据、LLM 推理最佳剪辑点、生成 EDL 剪辑决策表、ffmpeg 渲染、各切点自检。
适用场景
适合播客、口播、访谈、课程和短视频素材的快速粗剪,尤其适合希望用 AI Agent 批量处理原始素材、自动去除废话和沉默、统一调色与字幕风格的创作者与团队。由于依赖 ElevenLabs API Key,且转写质量会决定后续判断,使用前需要准备相应服务和密钥。它遵循先盘点、提策略、等确认再执行的流程,并非完全全自动,因此更适合粗剪,精剪与审美判断仍需人工参与。






