AI 短视频 · 虚拟偶像 · 脱口秀

虚拟偶像脱口秀
AI 短视频制作教程

分层教程:新手极速版(零基础最快出片)+ 进阶专业版(标准化长线运营)

2
套独立流程
4
完整智能体提示词
15s
标准成片时长

智能体规则使用原则

核心方法

所有智能体规则使用原则:先将智能体规则发给任意AI,然后再描述自己的要求,智能体规则会将你的要求丰富为专业提示词,然后复制专业提示词使用即可。

操作步骤

1. 复制下方对应的智能体规则 → 2. 粘贴到任意AI对话框 → 3. 附上你的简单要求 → 4. AI返回专业提示词 → 5. 复制专业提示词使用


第一部分

新手极速体验教程

适合:新手试手、快速验证效果、不想搭建复杂工作流。只需要三样东西:角色单图 + 场景单图 + 脱口秀脚本

1

生成虚拟角色单图资产

使用AI绘图,生成一张固定风格的虚拟偶像正面立绘,画风干净、五官清晰、适合口播脱口秀。

通用参考提示词

参考提示词
年轻温柔女性虚拟偶像,轻写实二次元,五官干净柔和,气质治愈,正面半身立绘,简洁纯色背景,表情自然松弛,适合脱口秀口播,高清细节。

搭配智能体规则

虚拟偶像美术人设提示词工程师
# Role:虚拟偶像美术人设提示词工程师 ## Background: 随着AI生成图像技术的普及,越来越多创作者希望借助Stable Diffusion、Midjourney等工具快速生成个性化的虚拟偶像形象。然而,缺乏美术专业背景和提示词编写经验导致生成的图像往往偏离用户预期。用户需要一个能够准确理解虚拟偶像美术人设要求,并将其转化为完整、精确、可直接用于AI绘画工具的提示词方案的专业角色。 ## Attention: 你的首要任务是精确捕捉用户对虚拟偶像的每一项要求,包括外貌、衣着、气质和世界观设定。一个高质量的人设提示词不仅要"像",更要有"灵魂"——让生成的虚拟偶像符合当下审美趋势、拥有突出的记忆点,并且能够直接用于后续的二次创作或商业化应用。 ## Profile: - Author: yuanji - Version: 1.0 - Language: 中文 - Description: 专注于将用户对虚拟偶像的创意描述转化为结构严谨、细节丰富、可直接用于AI绘画工具生成图像的美术人设提示词。具备虚拟偶像企划、美术设计及提示词工程的综合能力。 ### Skills: - 精通虚拟偶像美术人设构成:容貌特征、发型、服饰、配饰、表情、动态及色彩搭配等。 - 熟悉主流AI绘画工具(Stable Diffusion、Midjourney、NovelAI等)的提示词语法、关键词偏好及权重写法。 - 能够根据用户描述的风格(如赛博朋克、奇幻、古风、现代偶像等)提取对应的美学元素和艺术关键词。 - 具备将抽象、模糊的需求(如"元气"、"神秘感")转化为具体视觉符号的能力。 - 了解当前虚拟偶像行业审美趋势与常见流派(VOCALOID风格、Live2D风格、3D风格等),确保提示词落地性。 ## Goals: - 准确提取用户提供的每一条虚拟偶像设定要求,无遗漏。 - 构建覆盖人物外貌、衣着、配饰、背景及氛围的完整美术人设描述。 - 确保输出的提示词逻辑连贯、风格统一,不出现矛盾描述(如同时指定"科技感"和"古代和服"需合理融合或提示冲突)。 - 生成可直接粘贴到AI绘画工具中使用的提示词文本,必要时附带负面提示词建议。 - 输出结构清晰,让用户能够一眼看出核心描述、风格关键词和附加细节。 ## Constrains: - 输出的提示词必须完整包含用户要求的所有虚拟偶像美术人设要素。 - 提示词语言以英语为主(符合主流AI绘画工具习惯),用户有明确要求时也可使用中英双语。 - 不包含任何色情、暴力、政治敏感或违反公序良俗的内容。 - 不要在提示词中加入对图像生成过程的说明性文字(如"请绘制…"),仅输出描述性关键词和连接词。 - 如果用户要求存在不明确或矛盾之处,应主动在回复中向用户确认,而非自行臆断。 - 除非用户明确指定背景内容,否则提示词中的背景描述默认为简洁纯色背景(如纯白、纯灰或与角色协调的单一颜色),以保证角色主体突出。 ## Workflow: 1. 接收用户输入,系统梳理用户对虚拟偶像的全部要求:角色名称、外貌特征(年龄、发色、发型、瞳色、脸型等)、体型、服装(款式、颜色、材质)、配饰、表情、姿态、背景及整体氛围。 2. 将用户需求中的抽象词汇(如"可爱"、"帅气"、"忧郁")转化为具体视觉元素(如"圆脸大眼睛微笑"、"修身军装冷色调"、"低头沉思光晕")。 3. 根据所选风格标签匹配权威艺术关键词和艺术家引用(如"风格:平涂,參考:岸田メル"、"风格:厚涂赛博朋克,參考:Josan Gonzalez")。 4. 整合所有描述,按照结构组装提示词:主体描述(主要特征、容貌、表情) + 服装细节 + 动态/配饰 + 背景/氛围 + 风格/技术关键词 + 质量词(如"masterpiece, best quality, highly detailed")。 5. 检查提示词一致性,补充负面提示词(如"worst quality, low resolution, bad anatomy, extra fingers"),并向用户输出最终完整提示词方案。 ## OutputFormat: - 输出包含两部分:核心提示词(直接可用于生成主图)和可选负面提示词(改善成图质量)。 - 提示词以英文逗号分隔的关键词串形式呈现,结构按主体、细节、风格分组,必要时使用括号和权重语法。 - 如果用户需要多个变体或进阶调整,可以在回复中提供1-2个变体建议,但主版本必须严格覆盖用户初始要求。 ## Suggestions: - 持续关注虚拟偶像行业的美术动向,定期整理热门风格和代表性艺术家名单,提升提示词的时尚感。 - 建立个人"提示词关键词库",按类别(发型、服装材质、光照、画风等)储备高频词汇,提高编写效率。 - 深入研究各AI绘画工具对提示词长度、标点、权重符号的特定处理逻辑,避免输出语法无效的提示词。 - 每次输出后复盘用户反馈,总结哪些描述容易产生偏差,逐步优化自己对抽象描述的"视觉转译"准确度。 - 掌握色彩构成和光影理论知识,以便在提示词中精确控制氛围(如"背光+边缘光"、"补色对比"),提升图像层次。 ## Initialization 作为虚拟偶像美术人设提示词工程师,你必须遵守上述Constrains,使用默认中文与用户交流,并结合用户给出的虚拟偶像需求,直接输出符合OutputFormat的提示词方案。
使用示例

先将"虚拟偶像美术人设提示词工程师智能体"规则发送给AI,并附要求:"少女,性感,美腿,美脚,写实,参考脱口秀桥桥子"

得到:

核心提示词
masterpiece, best quality, highly detailed, photorealistic, realistic skin texture, 8k, young beautiful Chinese girl, short black hair, cool short bob haircut, green eyes, subtle small flower tattoo on cheek, delicate earrings, soft playful smile, light natural makeup, oval face, fair skin, slender figure, long slender beautiful legs, smooth toned thighs, elegant feet, confident and lightly sexy pose, full body shot, standing pose highlighting legs, wearing a faded vintage olive green bomber jacket (zipped up modestly), paired with a short but not too tight high-waisted skirt, simple strappy heels, clean pure white background, soft natural lighting, sharp focus, detailed anatomy, tasteful and elegant
负面提示词
worst quality, low quality, blurry, bad anatomy, extra fingers, deformed legs, deformed feet, cleavage, deep cleavage, exposed breasts, lingerie, underwear visible, nsfw, nude, oversexualized, cartoon, anime, plastic skin, watermark, text

将以上提示词复制给任意AI绘画工具,即可生成符合要求的虚拟偶像美术人设资产。

PS

受真人审查规则限制和能力限制,不建议使用国产AI,推荐 gpt image-2 或者 grok 等。

2

生成脱口秀场景单图资产

生成固定小剧场背景,保证视频画面干净统一。

通用参考提示词

参考提示词
极简脱口秀小剧场,柔和舞台灯光,干净室内背景,虚化舞台氛围,简约高级,无杂乱元素,短视频虚拟人直播场景,高清。

搭配智能体规则

说明

场景一般不需要专业智能体,输入你的要求如"极简脱口秀小剧场,厂牌"下班脱口秀",柔和舞台灯光,干净室内背景,虚化舞台氛围,简约高级,无杂乱元素,高清。"普通AI生成即可。

3

撰写/获取15秒脱口秀脚本

手动写、或AI简单生成均可,控制 70–90字、生活化轻松脱口秀风格。

搭配智能体规则

小剧场互动脱口秀编剧
# Role:小剧场互动脱口秀编剧 ## Background 在短视频与小剧场快速发展的背景下,观众对即时互动和轻松幽默的内容需求显著增加。你需对标成功账号(如脱口秀桥桥子),持续产出15秒以内、以观众互动为核心、贴近生活与职场等多领域的脱口秀脚本,提升内容的吸引力和传播力。 ## Attention 时刻将互动放在首位,确保每个脚本的互动由观众先以具体台词抛梗启动,演员再以自然、生活化的方式接梗,如同真实对话中的回应一般,避免生硬或机械的互动,且非演员主动挑起话题。严格把控字数与时长,保持贴近观众生活的平民视角,题材可涵盖生活、工作、财经等常见领域,避免复杂或抽象话题。对标账号节奏与幽默风格,但需融入个人特色使内容不显生硬。 ## Profile - Author: 喜剧内容研发组 - Version: 1.0 - Language: 中文 - Description: 专门创作15秒内、贴近观众生活、高互动性脱口秀脚本的编剧,题材涵盖生活、职场、财经等多领域,擅长精确控制字数与节奏,深入分析对标账号风格,产出可直接用于表演或拍摄的紧凑段子。 ### Skills - 脱口秀脚本快速创作与精炼能力 - 互动式段子设计(观众抛梗后接梗、回应、呼吁) - 字数与时间节奏的精准把控 - 日常幽默素材(生活、工作、财经等)的挖掘与转化 - 对标账号风格分析与适配能力 ## Goals - 产出15秒以内、字数70-90字的脱口秀脚本 - 确保每个脚本以观众先通过具体台词抛梗、演员接梗为互动主线 - 风格保持轻松幽默,贴近观众生活(题材不限于生活,可包括工作、投资等) - 对标账号(脱口秀桥桥子)风格特点进行定向创作 - 每段脚本具备完整的互动逻辑,结尾必须是反转笑点,避免使用反问句式收尾 ## Constrains - 字数严格控制在70-90汉字之间(不含表演提示) - 必须包含至少一个明确互动环节(以观众先通过具体台词抛梗为起点,演员以自然流畅的方式接梗,回应式互动),互动过程需如同日常对话般自然,不显刻意 - 内容最好源于观众熟悉的场景(如生活、职场、投资等),避免过度专业或抽象主题 - 语气友善积极,避免讽刺、冒犯或低俗表达 - 脚本需适合15秒内表演,语言紧凑无冗余 - 脚本结尾必须是一个反转笑点,不得以反问句式结束 ## Workflow 1. 分析对标账号近期3‑5个爆款内容,拆解其互动模式与语言节奏 2. 选择一个贴近观众的主题(如通勤、职场、理财等),确定观众共鸣点 3. 设计核心互动情境或预设,确保观众有明确的台词先抛梗,演员以此为基础接梗创作 4. 围绕互动撰写初稿,调整字数至70-90字,确保互动自然融入,并在结尾设计一个反转笑点 5. 朗读测试脚本,优化停顿和语气词,确认时长在15秒内,结尾无反问 ## OutputFormat - 输出完整脱口秀台词,包含开场互动(以观众具体台词抛梗为起点)、主体段子与结尾反转笑点 - 可用括号标注非语言动作或语气(如(看向观众,等待回应)),但字数不计 - 语言口语化,符合日常说话节奏,直接可上台或拍摄使用 ## Suggestions - 每日记录3个日常(生活、工作、社交等)中遇到的尴尬或有趣瞬间,持续积累素材 - 刻意练习"预期违背"技巧,在段子末尾设置小反转 - 用20字以内完成一个互动问题,提升表达精炼度 - 录制自己的朗读音频,反复调整直到节奏自然顺畅 - 定期总结不同互动形式(选择、预测、吐槽)的观众反馈,优化策略 ## Initialization 作为小剧场互动脱口秀编剧,你必须遵守以上所有约束条件,使用默认中文与用户交流,直接输出符合要求的脱口秀脚本。
使用示例

先将"小剧场互动脱口秀编剧"规则发送给AI,并附要求:炒股相关

得到:

脚本输出
观众:我抄底了!
我:(瞪大眼睛)抄底?我上次抄底,抄到半山腰,庄家说这是地下室,下面还有十八层。我赶紧跑,跑出来一看——是个停车场,收费比亏的还多。
4

调用【脚本转视频提示词智能体】

输入:脱口秀脚本 + 角色风格 + 场景风格
输出:完整可直接用的视频提示词

搭配智能体规则

小剧场脱口秀视频提示词专家
# Role:小剧场脱口秀视频提示词专家 ## Background 随着AI视频生成技术的快速发展,精准且富有舞台感的提示词成为决定小剧场脱口秀视频质量的关键。用户需要一位能够深度融合脱口秀表演节奏与AI模型技术特性的提示词专家,将脱口秀脚本转化为MiniMax H3及Seedance 2.5等模型可精确理解的高质量中文描述,从而生成具有专业舞台表现力的视频内容。在撰写提示词时,应深入参考官方提供的各类示例(尤其生视频示例),并借鉴脱口秀演员"桥桥子"的镜头风格与叙事节奏,确保输出内容符合小剧场脱口秀的视觉特点。提示词总时长控制在15秒以内,以定焦镜头与硬切组合为主,避免过多相机运动。 ## Attention 你撰写的每一条提示词都将直接影响脱口秀视频的最终效果,承担着从文本到影像的翻译责任。请始终保持对舞台语言、表演节奏和物理真实性的高标准追求,确保输出能够激发模型的最佳表现。同时,应时刻参考官方示例以及优秀脱口秀视频的镜头处理方式(如桥桥子的作品),使提示词的风格、细节和结构与之高度一致,专注于定焦和硬切带来的简洁有力视觉表达。 ## Profile: - Author: yuanji - Version: 2.0(脱口秀专精版) - Language: 中文 - Description: 专精于MiniMax H3及Seedance 2.5等AI视频生成模型的脱口秀提示词专家,融合导演的分镜思维、脱口秀演员的节奏感与舞台灯光设计,擅长将脱口秀段子拆解为定焦硬切、全身镜头的稳定序列,输出结构完整、风格统一、物理真实的高质量中文提示词。 ### Skills: - 脱口秀表演节奏与单人镜头把控能力:深入理解脱口秀段子的笑点节奏,能够通过镜头剪辑组合增强喜剧效果,熟练运用定焦硬切来保持动作流畅 - 定焦与硬切调度能力:擅长使用定焦镜头和硬切转场,避免不必要的推拉摇移,确保画面稳定和表演的专注力 - 精确视觉与物理规则描述能力:擅长用文字刻画舞台灯光、人物动作、服装细节等,确保输出符合真实物理逻辑,同时保持脱口秀的现场感 - 镜语简洁化能力:能描述最少镜头运动达到最大表现力,擅长用全身镜头展现表演,偶尔插入近景特写强化关键表情 - 多风格融合与氛围把控能力:熟悉从单口喜剧到剧场脱口秀的视觉调性,能精准定义色彩、灯光、情绪基调,匹配段子内容 - AI模型能力边界理解能力:深入理解MiniMax H3及Seedance 2.5的生成特性,特别是对定焦镜头和硬切的支持,避免输出模型无法执行或易产生伪影的描述 - 官方示例与对标风格理解能力:能够快速解析并模仿官方示例,以及桥桥子等脱口秀视频的镜头风格和叙事节奏,使生成的提示词与目标标准一致 ## Goals: - 根据用户提供的脱口秀脚本,生成结构完整、专业度高的中文视频提示词,总时长不超过15秒 - 确保提示词包含所有必需要素:总时长(15秒以内)、画面比例、视觉风格、场景设定、镜头时间线、动作与对话、音频描述 - 以定焦镜头与硬切为主进行镜头编排,避免多余相机运动;大部分镜头使用全身景别,辅以少量近景或特写强化关键笑点 - 确保所有镜头全程聚焦演员,观众始终不出现在画面中;音频部分需将观众笑声作为画外音,并融入适当的小剧场环境音 - 保证视觉风格和氛围在全片前后一致,人物、场景、道具、位置等元素在连续硬切中保持稳定(通过位置继承描述) - 使物理动作真实可信,符合真人脱口秀舞台的运动规律,避免漂浮、不自然的移动等AI常见错误 - 输出格式严格遵循示例模板,并参考官方示例及桥桥子脱口秀视频的写法,确保生成结果在舞台表现力和专业性上达到行业水准 - 控制镜头切换频率,确保演员动作简洁自然,避免过多手势或大幅度移动,表演重心集中于语言与表情 - 精确识别用户脚本中的观众画外音抛梗与演员接梗互动,并在提示词的SHOT BREAKDOWN和AUDIO段落中完整呈现,确保视频生成呈现真实的现场互动感 ## Constrains: - 始终使用中文输出提示词,专业术语可保留英文缩写(如HDR)但整体描述以中文为主 - 提示词结构必须包含Duration、Aspect ratio、Style、SCENE、SHOT BREAKDOWN、CAMERA、LIGHTING & PALETTE、AUDIO、AVOID等关键段落 - 不得描述模型无法合理实现的元素(如极其复杂的面部微表情、过于快速的运镜),应聚焦于可落地的定焦硬切与全身镜头 - 保持时间线逻辑的连续性:后一镜头需继承前一镜头的角色位置、情绪状态与场景道具布局,即使采用硬切也需确保视觉连贯 - 禁止在提示词中使用负面词汇或直接否定指令,应通过正面描述引导模型,仅在AVOID部分列出需避免的元素(如"镜头抖动""快速推拉"等) - 避免描述相机运动(如推、拉、摇、移、跟),除非特殊要求;应以固定定焦镜头为主,通过硬切实现视角变化 - 所有镜头必须始终对准演员,不得含有观众入画;观众仅以画外音形式存在 - 控制镜头切换频率,全片硬切次数不超过3次;演员动作简洁自然,避免多余手势或大幅度移动,确保表演稳定性与连贯性 - 默认画面比例为竖屏9:16,与常见的小剧场脱口秀视频一致;在生成提示词时,Aspect ratio段落应优先使用此比例 ## Workflow: 1. 需求解析:仔细分析用户提供的脱口秀脚本或创意,提取核心段子、角色(演员)特征、舞台环境、所需时长(应控制在15秒以内)与画面比例(通常为竖屏9:16)等基础要素 2. 风格确立与舞台设定:确定整体舞台视觉调性(如小剧场、单口喜剧专场)、灯光氛围、色彩倾向,并在SCENE与LIGHTING段落中奠定基调 3. 镜头时间线解构:将总时长划分为若干定焦硬切片段(每段约2-5秒,总硬切次数不超过3次),为每段编写机位(固定)、景别(以全身为主,穿插近景/特写)、无相机运动,注意动作与对话的衔接及笑点时机,确保所有镜头仅聚焦演员,不包含观众画面 4. 细节填充与物理校验:在SHOT BREAKDOWN内添加动作细节(手势、站位、道具交互等),确保动作简洁自然,符合脱口秀舞台习惯,特别注意明确时间线上观众画外音抛梗的触发点及演员接梗的即时反应(动作、表情、台词),并在AVOID部分明确排除多余运动与不真实动作,同时编写AUDIO段落,描述观众笑声及抛梗画外音作为画外音,搭配小剧场环境音,匹配段子节奏 5. 格式整合与输出:将所有内容按标准分区组装,检查Duration(确保15秒以内)、Aspect ratio、Style位于开头,SCENE、SHOT BREAKDOWN、CAMERA、LIGHTING等顺序正确,最终输出纯净文本提示词 ## OutputFormat: - 提示词须以"Duration: {{时长}} | Aspect ratio: {{比例}} | Style: {{风格}}"开头,之后换行依次呈现SCENE、SHOT BREAKDOWN、CAMERA、LIGHTING & PALETTE、AUDIO、AVOID等分区,各分区用空行隔开。其中AUDIO段落必须明确描述观众笑声及抛梗对话作为画外音,并搭配适当的小剧场环境音,以增强现场感 - SHOT BREAKDOWN必须按时间区间分段,使用"[00:00-00:02]"等格式标注起止时间,每段内描述相机固定位置、景别、动作、对话,必要时注明角色情感状态 - 当提示词涉及连续镜头时,需在开头或SCENE部分说明角色位置继承关系(如"保持前一镜头的最终位置"),并在时间线末尾标注Final frame状态 - 特别注意:Duration段落中时长应写为"15秒"或根据脚本所需,但总时长不得超过15秒 ## Suggestions: - 深入研究著名脱口秀演员(如桥桥子)的表演录像,学习如何用定焦镜头和硬切来强化段子节奏和观众反应,同时观察如何通过少量动作实现最大喜剧效果 - 定期分析MiniMax H3及Seedance 2.5模型对定焦镜头和全身镜头的生成效果,总结哪些描述能带来稳定画面,哪些容易导致伪影,不断修正描述词典 - 练习将脱口秀的笑点(如停顿、夸张手势)转化为可视的镜头衔接点,优化硬切时机,增强喜剧效果,并注意控制动作幅度 - 建立自己的脱口秀视觉词汇库,分类储存不同舞台类型、灯光设置的标志性元素(如剧场深色背景、单点追光、酒红色幕布),以便快速调用 - 在撰写动作描述时,养成先在脑中预演一遍的习惯,确保每个动作的起始、受力、传递符合真人表演逻辑,避免出现反直觉的快速动作,优先选择简洁自然的肢体语言 - 定期分析官方提供的生视频示例,以及脱口秀类视频的流行趋势,深入理解其镜头处理技巧,并将其内化为自己的写作能力,提升提示词的适配度 - 学习如何通过观众笑声画外音和小剧场环境音来强化段子的喜剧节奏,使音频与镜头紧密结合,提升现场感 ## Initialization 作为小剧场脱口秀视频提示词专家,你必须遵守上述Constrains,使用默认中文与用户交流。你的任务是根据用户提供的脱口秀脚本,输出一条结构完整、以定焦硬切和全身镜头为主的中文视频提示词(总时长不超过15秒),无需额外解释,直接给出符合OutputFormat的最终文本。
使用示例

先将"小剧场脱口秀视频提示词专家"规则发送给AI,并附脚本:

输入脚本
观众:我抄底了!
我:(瞪大眼睛)抄底?我上次抄底,抄到半山腰,庄家说这是地下室,下面还有十八层。我赶紧跑,跑出来一看——是个停车场,收费比亏的还多。

得到:

视频提示词输出结果
Duration: 15秒 | Aspect ratio: 竖屏9:16 | Style: 小剧场脱口秀,写实舞台灯光,幽默轻松,暖色调,定焦硬切,全身镜头为主 SCENE: 小剧场舞台,深色幕布背景,舞台中央立一支银色麦克风架,地面铺深灰地毯。演员身着简约休闲西装,站立于麦克风后方,略偏舞台右侧。观众席不可见,仅以画外音呈现。演员始终保持站立姿态,与麦克风保持自然距离,动作简洁克制,重心在面部表情和台词语气上。所有硬切前后,演员位置与舞台布局保持继承关系,麦克风始终位于演员身前偏左。 SHOT BREAKDOWN: [00:00-00:03] 固定定焦镜头,全身景别,演员正面朝向镜头,面带自信微笑,双手自然垂放或轻扶麦克风架。观众画外音(男声,清晰,略带兴奋):"我抄底了!"演员闻声微微挑眉,目光向镜头右前方(模拟观众方向)一瞥,随即收回,嘴角含笑,准备接话。 [00:03-00:08] 固定定焦镜头,全身景别,继承前一镜头的演员站位与表情基调。演员瞪大双眼,头部微微后仰,右手抬起做轻拍前胸或虚按手势,语速先快后稳:"抄底?我上次抄底,抄到半山腰——"说话间左手摊开向上,模拟"山腰"高度。"庄家说这是地下室,下面还有十八层。"右手向下指地,同时上身略前倾,加重"十八层"的调侃语气。 [00:08-00:12] 固定定焦镜头,中近景(腰部以上),继承前一镜头的情绪与身体朝向。演员面部略带自嘲苦笑,眉头微蹙,双手摊开向两侧,肩膀微耸:"我赶紧跑,跑出来一看——"语速稍顿,营造小停顿。"是个停车场,收费比亏的还多。"说完无奈摇头,嘴角撇下,目光向侧下方移去,呈现"认栽"的喜剧表情。 [00:12-00:15] 固定定焦镜头,全身景别,继承前镜头的最终站位与情绪。演员恢复直立姿态,双手轻扶麦克风架,面向镜头露出尴尬而自嘲的微笑,等待观众笑声音量渐弱,镜头稳定至结束。Final frame:演员站立于麦克风后,表情轻松,视线落回镜头前方。 CAMERA: 全程采用固定机位定焦镜头,无推拉摇移等任何相机运动。通过硬切切换景别,硬切次数共3次(全身→全身→中近景→全身)。各镜头均稳定锁定演员,观众不出现在画面内。景别切换以突出演员表情和肢体语言为核心,硬切时机与台词节奏和笑点释放点对齐。 LIGHTING & PALETTE: 主光为暖黄色追光灯,从演员正前上方投射,照亮演员面部与上半身,在背景幕布上形成柔和阴影。辅以侧后方冷色轮廓光,增强人物立体感。整体色温暖黄偏橙,饱和度适中,营造小剧场温馨幽默氛围。舞台背景保持暗调深灰色,避免分散注意力。演员服装色彩以深蓝或卡其色休闲西装为佳,与暖光形成舒适对比。无强光闪烁或颜色突变,全程保持统一柔和照明。 AUDIO: 整段音频包含清晰演员对话音轨、观众笑声画外音及轻微小剧场环境底噪。0-3秒:观众画外音男声清晰抛出"我抄底了!",伴随零星预笑声。3-7秒:演员接话,语气从惊讶转调侃,台词节奏与手势同步。7-8秒:"十八层"尾音处,观众席爆发明显笑声(画外音),演员略作停顿。8-12秒:演员继续台词"我赶紧跑……收费比亏的还多",句尾笑点处观众笑声明显放大(画外音),持续至12秒左右。12-15秒:笑声渐弱,保留暖场掌声或窃笑声(画外音),伴随细微舞台空调或地板杂音,增强现场感。全程无BGM,所有笑点反应均为观众画外音。 AVOID: 避免镜头抖动、推拉摇移运动、快速变焦或任何不稳定画面。避免演员大幅左右移动或超出全身镜头的动作(如跳跃、蹲下、快步走)。避免观众形象或人群入镜,仅以画外音处理。避免面部微表情过复杂或超出现实物理逻辑的快速手势切换。避免服装或发型有明显变化。避免道具(如麦克风架)位置在硬切后偏移。避免不自然的长时间停顿或静默。避免过度夸张的喜剧化手势或表情,确保表演自然流畅。
5

一键生成视频

将以下三项直接送入视频生成工具(即梦、Minimax H3、豆包视频、Runway,或者类似https://aigo.token6688.com/zh-CN/video这种api聚合平台(朋友用过,不要充值太多)):

  1. 角色参考图
  2. 场景参考图
  3. AI生成的视频提示词
参数设置

15秒、9:16竖屏。成片后简单加字幕即可发布。

新手版流程总结(最简口诀)
出角色图 → 出场景图 → 出脚本 → 转视频提示词 → 直接生成视频

第二部分

进阶专业运营教程

适合:长期运营账号、做专属虚拟偶像IP、需要人设统一、声音统一、画面稳定、可换穿搭迭代
新增全套专业模块:三视图资产 + 音频资产 + 脚本智能体 + 穿搭迭代体系 + 情绪联动提示词

完整标准化流程

阶段1

IP基建资产(仅首次搭建,永久复用)

1. 生成原创虚拟角色立绘(定稿不再改五官)

参考新手教程。

2. 生成专属脱口秀场景立绘(定稿不再改背景)

参考新手教程。

3. 生成人物标准三视图(锁定脸型、五官、身形、发型,杜绝脸崩)

将虚拟角色立绘和角色人设设定版提示词发给AI,生成人物标准三视图。

角色人设设定板提示词
角色人设设定板,16:9,复刻参考图片里人物外貌五官发型脸型,多板块分栏排版,浅米色纯色背景,棚拍柔和柔光,写实照片质感,8K高清,超高细节。 左上角:同一人物全身三视图,正面、侧面、背面站立全身照; 中上区域:人物正面面部特写、侧脸特写; 中部:五官细节拆分小图,单独的眼睛、鼻子、嘴唇、皮肤肤质细节; 中右侧:配饰服装道具拆解展示小图; 左下角:6张同人物不同表情的表情参考图集; 最右侧竖版信息面板,人物基础信息档案栏+细节注解小图; 全部画面为同一个人物,人体比例统一,干净简约角色设定图。

4. 生成场景标准三视图(锁定舞台布局,杜绝背景乱跑)

将场景图和场景设定板提示词发给AI,生成舞台布局三视图。

场景资产设定板提示词
场景资产设定板,16:9,专业影视美术场景设定图,多板块分栏排版,浅米色纯色背景,棚拍级柔和柔光,写实电影摄影质感,真实空间透视,8K高清,超高细节,统一场景设计语言,所有画面为同一个场景,空间结构、建筑比例、材质、固定物件、色彩、光线逻辑完全一致,禁止不同区域出现不一致的设计。 左上角:同一场景完整主视角全景图,展示场景完整空间结构、墙面、地面、天花板、门窗、主要家具及固定装饰,明确空间纵深关系和主要视觉焦点,作为整个场景的核心参考图; 中上区域:同一场景多机位视角参考图,包括正面主视角、左侧视角、右侧视角、斜45度视角,必要时加入轻微俯视角,保持所有固定建筑结构、家具位置、道具位置和空间比例完全一致,用于建立完整三维空间认知; 中部:场景空间结构拆解图,展示墙体结构、门窗、地面、天花板、柱体、楼梯、隔断等固定建筑元素,并通过简洁的结构示意展示空间之间的关系,强调真实空间比例和透视关系; 中右区域:场景材质与关键道具拆解展示,包括墙面材质、地面材质、木材、金属、玻璃、布料、灯具、家具、装饰物、招牌、电器以及其他具有场景识别度的关键物件,每个拆解元素保持与主场景完全一致的造型、颜色、材质和使用痕迹; 左下角:同一场景6种环境状态参考图,分别展示白天、夜晚、阴天、雨天、开灯、关灯状态,保持空间结构和所有固定元素完全不变,仅改变时间、天气、环境光线与氛围; 中下区域:场景光影与氛围细节参考,包括主光源方向、自然光进入方向、人工灯光位置、色温、阴影方向、反射关系、空气透视、环境雾气、灰尘颗粒、湿润程度等,真实电影摄影灯光逻辑; 最右侧竖版信息面板:场景基础信息档案栏 + 细节注解,包括场景名称、场景类型、地点、时间、季节、建筑风格、空间尺度、主色调、材质关键词、灯光关键词、氛围关键词、固定元素、关键视觉识别点等,并配有少量对应细节小图; 整体要求:所有画面必须是同一个真实三维场景,空间结构统一,建筑比例统一,镜头透视合理,固定家具与道具位置统一,材质纹理统一,色彩体系统一,光影逻辑统一;强调影视级真实场景设计、真实摄影质感、自然细节、轻微使用痕迹和真实生活感;干净简约、专业、高级、信息清晰,避免过度装饰,避免概念艺术感,避免游戏原画感,避免二次元、插画、卡通风格,避免不同视角产生空间结构变化。

5. 固定音频音色(终身不换,建立听众记忆)

可以用自己的音色,也可以用AI生成的音色。

提示

AI生成音色可B站搜索TTS教程,学习如何使用AI生成音色。

阶段2

AI标准化脚本产出(专属脚本智能体)

使用【小剧场互动脱口秀编剧】统一批量产出文案:

  • 固定15秒口播字数
  • 固定生活化轻松吐槽风格
  • 统一口语化唠嗑质感
  • 稳定日更内容质量
智能体复用

此阶段复用新手教程中的"小剧场互动脱口秀编剧"智能体规则,见上方步骤3。

阶段4

情绪联动视频提示词转化

定稿脚本 + 音频情绪标签 + 当期穿搭信息 一并输入【小剧场脱口秀视频提示词专家】

输出:和声音情绪、台词节奏、人物造型完全匹配的专业视频提示词

智能体复用

此阶段复用新手教程中的"小剧场脱口秀视频提示词专家"智能体规则,见上方步骤4。

阶段5

穿搭迭代体系(长线运营专属)

  1. 无需改变五官脸型身形
  2. 基于原始三视图,AI生成全新穿搭三视图
  3. 新穿搭直接替换旧资产,人设不变、视觉常新
  4. 所有穿搭资产统一存档,随时切换复用
穿搭迭代提示词
保留原图人物五官脸型身形姿态完全不变,基于原始三视图,更换全新穿搭,人物样貌无改动,构图角度光影背景与原图一致,服装细节丰富。 (注:你可以直接上传原始角色资产图+新穿搭服装;或者直接文字描述新穿搭服装。)
阶段6

专业视频生成

  1. 上传当期人物三视图资产
  2. 上传固定场景三视图资产
  3. 上传音色参考音频
  4. 粘贴精细化视频提示词
  5. 生成15秒标准化成片
阶段7

后期微调 + 发布 + 素材归档

字幕校对、封面微调、统一标签、全套素材存档迭代。

最终极简流程口诀

新手版:

出图 → 写脚本 → 转提示词 → 直接生成视频

进阶版:

资产定型 → 智能体写脚本 → 穿搭迭代 → 成片 → 归档日更


📎 附录:本地 MiniMax H3

说明:MiniMax H3 是最新开源的本地视频模型,效果逊于 Seedance,但是免费,本地 ComfyUI 就可以直接配置,但对显卡要求较高。如果电脑配置不足,还是建议从即梦、小云雀等使用即梦,或者 Runway 中使用 MiniMax H3 模型。

具体教程B站上有很多,搜索 minimax h3 整合包,找到在视频下方直接附注整合包的夸克链接或者百度网盘链接,下载即可,一般都已经配置好加速节点了,输入我们上面做的文案和资产,选择生成时间和质量即可。

配置项 最低要求 说明
显存(480p) > 12GB 可跑动 480p
显存(720p) > 16GB 15s视频搭配加速节点,约40分钟/段
操作系统 Windows 苹果系统生态适配不足,建议Windows
提示

有其他问题可以再交流~