产品 + 开发 · 进行中 · 开发中 · 探索阶段
产品视频生成 Agent
一个正在做的探索:用一个 Agent 把"产品介绍视频"的生产自动化 —— 自动分析产品、规划脚本、生成片段、剪辑并自我复核。
核心:能不能用一个 Agent,把产品介绍视频从”一句话 / 一张图”自动跑到成片? 这是我正在推进的前沿探索 —— 目前核心链路已打通、能端到端产出,但产物质量还在打磨、远未到发布标准。放它,是为了体现方向感和对 Agent 的持续投入,明确标注开发中。
一、为什么做
工作中我常要把一个产品 / demo 拍成介绍视频,但走品牌部”拍摄 + 剪辑”流程重、周期长,和”快速验证”的节奏不匹配 —— 做产品的团队、跨境电商商家也有同样的痛点。
但对我个人,出发点其实是双重的:一边解决这个痛点,一边用一个真东西验证我对 Agent 架构的理解(ReAct、DAG、harness 等) —— 不停留在读 paper / 理论层面,而是看这些框架能不能真的编排出一个端到端跑通、产物可行的系统。我自己就是第一个用户。
二、想做成什么
目标产物:1–2 分钟的产品短视频,带字幕、配音、BGM,并自动产出平台话术(钩子 / 卖点 / CTA)。
设想的用户:“营销先行”打法的团队(产品还没量产,先用视频测市场、拉反馈)和跨境电商商家 —— 不用自己花大价钱、大精力请团队拍摄剪辑,就能批量出片。
三、Agent 的思路
完整链路:产品分析 → 脚本 / 分镜 → 自我复核(评分 → 改写)→ 首尾帧出图 → 片段生成 → 配音 + BGM → 自动剪辑 → 成片。
和”手动用工具做视频”的区别,在于它真正自动决策与编排:脚本 / 分镜不达标会自动评分重写、DAG 并发调度、节点失败自动改 prompt 重试 + 产物硬校验、预算护栏 + 状态机(超预算暂停等确认)。
一个核心理念:好的 Agent 不是”串一堆 LLM 调用”,而是用确定性工程把 LLM 的不确定性包起来。 所以系统绝大部分是工程代码(编排、调度、重试、校验),LLM 只在三个真正需要”理解 / 创意 / 判断”的点介入 —— 理解意图、生成 prompt、质量评估;能用代码解决的绝不交给 LLM —— 这样更可控、可复现,也更便宜。
技术上自研了一套轻量 Agent 框架(ReAct 规划 + DAG 调度 + Workflow 执行),而非套用 LangChain;视频生成走”首尾帧”模式(比纯文 / 图生视频更可控、分镜一致性更好),主要用 Seedance(视频)、gpt-image(关键帧)、ffmpeg(剪辑)等。
四、当前进展(诚实)
- ✅ 核心链路 + Agent 模式(状态机 + DAG + 流式 Web 工作台)已跑通,能端到端产出。
- 🚧 已生成 20+ 条开发测试片(用于验证链路、调 prompt 与参数)—— 质量尚未达标,是开发测试产物,不是成品。
- 下一步重点:对生成出来的成片画面做多模态视觉质检 —— 哪段不达标就重做哪段,补上”不达标不出片”的闭环。这正是当前产物质量上不去的关键缺口。
五、访问入口
- 样片 / Web 工作台演示:[待填充 — 等产物达标后再放,避免拿未达标的测试片对外]