数字人视频低成本怎么做?lanshu:一张授权图+文案自动跑出带字幕成片
「lanshu-create-ai-presenter-video」是一个面向 Codex 的开源数字人视频技能(MIT,Python,913⭐):给它主题/文案和一张授权人物图,它自动组织文案、配音、人物生成、口型校准、字幕、关键词动效、剪辑、渲染和质检,一条龙产出带实时字幕+封面的成片,且源码不绑定任何厂商/模型。适合做知识口播、产品讲解、课程/培训口播的创作者。注意它是给 Agent 用的技能、不是独立 App;开源的是编排,配音/人物生成的模型能力本地没有仍需付费;人物图须获授权且为清晰成年人。
这是什么
lanshu(cclank/lanshu-create-ai-presenter-video)是一个面向 Codex 的开源「数字人视频」制作技能。它不是一个独立的视频 App,而是装进 Codex 里的一组指令(Skill):你只要给它一份文案(或一个主题)+ 一张你有授权、含清晰人物的参考图,它就会自动把下面这几件事串成一条产线:
文案组织 → 配音 → 人物生成 → 口型校准 → 实时字幕 → 关键词动效 → 剪辑 → 渲染 → 质检交付。
仓库源码目前 913⭐、MIT 协议、用 Python 写成,2026-08-20 上线。
亮点
- 不绑死任何厂商/模型:源码里不含任何服务商、模型名或私有接口。它按「当前环境有什么能力」来选工具——本地能跑的就用本地,跑不了才走付费生成。想换模型、换服务商,不改代码。
- 一次跑完一整条产线:从脚本到画面到字幕到 QA 报告,一套流程推进到底,不用在多款工具之间来回导。
- 输入最少只要两个:一个主题或一份完整文案 + 一张参考图。可选输入包括声音样本、B-roll、品牌素材、目标平台、时长、横竖屏(16:9 / 9:16)、风格、水印、结尾引导。
- 省上下文的读档设计:把流程拆成三份参考文档——
generation.md(输入检查/文案/声音/能力选型/人物提示词与一致性)、editing.md(时间轴/开场与结尾/字幕预设/人物侧关键词动效/封面与导出)、qa-recovery.md(技术+人工验收与常见故障修复)。Codex 只在进入对应阶段时读对应文档,减少 token 占用。 - 带质检交付:产出前会做技术验收与人工验收(检查口型同步、字幕、封面),最后交回一个带 QA 报告的成片。
怎么用
前提:一个能加载本地 Skill 的 Agent 环境(如 Codex)、Python 3.9+、FFmpeg / ffprobe、bash / jq / awk。
# 1. 装进 Codex 的 skills 目录
git clone https://github.com/cclank/lanshu-create-ai-presenter-video.git \
~/.codex/skills/lanshu-create-ai-presenter-video
# 2. 初始化一个任务目录(给文案/主题 + 授权人物图)
SKILL_DIR=~/.codex/skills/lanshu-create-ai-presenter-video
python3 "$SKILL_DIR/scripts/init_job.py" \
--job-dir ~/Videos/my-presenter-video \
--presenter-image ~/Pictures/presenter.png \
--topic "视频主题" \
--duration 60 \
--aspect 9:16 \
--rights-confirmed \
--adult-presenter-confirmed
# 3. 查看并补全 job.json 后跑 preflight 校验
python3 "$SKILL_DIR/scripts/preflight.py" ~/Videos/my-presenter-video/job.json
也可以在 Codex 对话里直接说一句:使用 $lanshu-create-ai-presenter-video,把这份文案和人物图做成一条 16:9、30 秒、有实时字幕的数字人讲解视频。 剩下的交给它按能力选型、推进、质检。
适合谁 + 三个诚实的注意
适合:做知识类/口播短视频、产品讲解、课程或培训口播,想把「写好的稿子变成有人讲的竖屏视频」交给 Agent 的创作者;尤其在意不把流程锁死在某个订阅制 AI 视频平台(类似 Synthesia / Higgsfield)的人——这条产线是开源的,能力层可换成你自己的模型。
三个注意:
- 它是给 Agent 用的「技能」,不是独立 App:你得有一个能加载本地 Skill 的 Agent 环境,否则装不起来;它做的是「编排 + 质检」,不提供一个点开的图形界面。
- 免费的是编排,不是生成:项目本身开源 MIT 不要钱,但配音、人物生成这几步它会优先选本地模型,本地跑不了才走付费生成。想真零成本,得自己准备本地可跑的人物/语音模型;否则会产生 API 费用。
- 人物授权是硬前提:参考图必须是你有授权、含清晰成年人的照片,并要在
job.json里勾确认(--rights-confirmed/--adult-presenter-confirmed)。这是它前置校验的一部分,别拿未经授权的真人脸来跑。
项目信息
- GitHub:https://github.com/cclank/lanshu-create-ai-presenter-video