跳到主要内容
加加绒加加绒

让Agent像读代码一样剪视频

video-use —— 借助 Claude Code 实现视频剪辑,完全开源。 把原始素材放入文件夹,和 Claude Code 对话,就能得到成品 final.mp4。适用于各类视频内容:口播讲解、混剪、教程、旅行记录、访谈等,无需预设模板,也不用操作菜单。

可在线试用:https://cloud.browser-use.com/v4?utm_campaign=video-use-use-in-cloud&utm_source=github

核心功能

https://github.com/browser-use/video-use#what-it-does

自动剔除语气词(嗯、啊、口误重说片段)以及镜头之间的空白停顿

对每一段素材自动调色:电影感暖调、通透硬朗中性风,或是自定义 ffmpeg 调色脚本

所有剪辑切点添加 30 毫秒音频淡入淡出,避免爆音

烧录字幕,样式可自定义;默认采用两词一组大写字幕块

可并行启动多个子智能体,调用这些工具生成动画叠加层: https://github.com/heygen-com/hyperframes、https://www.remotion.dev/、https://www.manim.community/、PIL

在每一处剪辑切点对渲染结果做自检,确认无误后再交付成品

项目进度保存在 project.md,隔一段时间继续编辑也能接续上次工作

部署提示词

https://github.com/browser-use/video-use#setup-prompt 粘贴到 Claude Code、Codex、Hermes、Openclaw,或是其他具备 shell 权限的智能体中:

帮我部署 https://github.com/browser-use/video-use

先阅读 install.md,完成仓库安装、配置 ffmpeg、将该能力注册到你正在使用的智能体,同时配置 ElevenLabs API 密钥;需要密钥时告诉我,我可以粘贴。 之后阅读 SKILL.md 了解日常使用方法;脚本都放在 helpers/ 目录,务必查看。 安装完成后,不要手动转录视频。只需告知智能体准备就绪,等待我把素材放入文件夹即可。

智能体会自动拉取代码仓库、安装依赖、注册能力,并一次性提示你填入 ElevenLabs API 密钥(密钥在 https://elevenlabs.io/app/settings/api-keys 获取)。

然后让智能体指向存放原始视频素材的文件夹:

cd /path/to/your/videos claude # 也可以用 codex、hermes 等

如果你想在自己的 VPS 或 Telegram 上持续启用剪辑能力,可以通过 https://browser-use.com/bux 运行智能体。 相关演示 TikTok:https://www.tiktok.com/@browser_use/video/7639824093721758989

在会话里直接下达指令:

将这些素材剪辑成一条发布预告片

智能体会清点全部素材,给出剪辑方案,等你确认后,在素材目录下的 edit/ 文件夹生成 final.mp4。所有输出文件都放在<videos_dir>/edit/,能力本身的目录保持干净。

手动安装

https://github.com/browser-use/video-use#manual-install 如果你想手动部署:

1. 克隆仓库,并创建软链接接入智能体的能力目录

git clone https://github.com/browser-use/video-use ~/Developer/video-use ln -sfn ~/Developer/video-use ~/.claude/skills/video-use # Claude Code

ln -sfn ~/Developer/video-use ~/.codex/skills/video-use # Codex

2. 安装依赖

cd ~/Developer/video-use uv sync # 备选:pip install -e . brew install ffmpeg # 必装 brew install yt-dlp # 可选,用于下载网络视频素材

3. 配置 ElevenLabs API 密钥

cp .env.example .env $EDITOR .env # 在文件内填写 ELEVENLABS_API_KEY=...

工作原理

https://github.com/browser-use/video-use#how-it-works 大模型并不会直接 “观看” 视频,而是通过两层信息读取视频内容,精准到单词级别的剪辑切点。 示意图:https://github.com/browser-use/video-use/blob/main/static/timeline-view.svg

第一层 — 音频转录(默认启用) 每条素材调用一次 ElevenLabs Scribe,输出带单词时间戳、说话人区分、音频事件标记(笑声、掌声、叹气)的文本。所有素材打包存入约 12KB 的 takes_packed.md,这是大模型读取素材的核心载体。

C0103 (时长: 43.0秒,8个语句片段)

[002.52-005.36] S0 智能网页代理做的事情里,九成都是无效工作。 [006.08-006.74] S0 我们解决了这个问题。

第二层 — 可视化合成(按需调用) timeline_view 可以为任意时间范围生成包含胶片帧、波形图、文字标注的 PNG 图。仅在需要做判断时调用:比如模糊停顿片段、多版本素材对比、校验剪辑切点。

普通思路:3 万帧 × 1500 token = 4500 万 token 的冗余信息 video-use:12KB 文本 + 少量 PNG 图片

原理类似 browser-use:不给大模型传完整截图,而是提供结构化 DOM;只不过这套方案是针对视频。

工作流水线

https://github.com/browser-use/video-use#pipeline 转录 → 打包文本 → 大模型推理剪辑方案 → 生成 EDL 剪辑表 → 渲染 → 自检                          │                          └─ 存在问题?自动修复并重渲染(最多重试 3 次)

自检环节会在成品所有剪辑切点运行 timeline_view,检查画面跳变、音频爆音、字幕异常。只有自检通过,你才能看到预览。

设计原则

https://github.com/browser-use/video-use#design-principles

文本为主,按需调取画面;不批量灌帧给大模型。转录文本是核心信息载体。

音频优先,画面跟随音频;剪辑切点依据语音边界与静音间隙判定。

询问 → 确认 → 执行 → 自检 → 保存。未经方案确认,绝不擅自修改剪辑。

不对视频内容类型做任何预设;先读取素材、询问需求,再剪辑。

12 条硬性生产规则,艺术风格自由发挥。成片的技术正确性不可妥协,审美风格不作强制约束。

术语小注解

EDL:编辑决策表,影视行业标准剪辑文本文件,记录所有剪辑时间点

speaker diarization:说话人区分,自动识别音频里不同说话人

burn subtitles:硬字幕,直接烧进视频画面,不是外挂字幕

ffmpeg:开源音视频处理工具

VPS:云服务器

shell:命令行终端

cr:browser-use

0

评论 0

更多

登录后可点赞、收藏、评论和举报。

还没有评论,先发起一个具体问题。

0/2000