NOTEAI Engineering

让 AI 演员看起来更真实:把审核规则写进制作流程

本文结论

通过复用经过审核的虚构演员、按镜头因果设计表演、在生成视频前检查起始图、按镜头重要性选择模型,并用文件哈希确保审核只对当前版本有效。

一条 AI 视频可以通过全部技术检查,演员仍然显得不真实。文件能正常解码,时长、字幕和响度都正确,人物身份也大致连续,但皮肤像蜡或锐化过度,表情长期停在同一种皱眉,多个镜头重复相同手势,身体与地面、道具和其他人物之间缺少重量关系。

继续修改提示词只能偶尔改善单次结果。要稳定提升质量,需要把真人感拆成一组能够检查、记录并阻止流程继续执行的规则。这些检查从视频生成前开始,并一直覆盖到最终成片审核。

旧流程为什么仍会产生不自然的表演

旧流程已经有详细镜头提示和三阶段表演结构,但仍有几处缺口让僵硬表演通过:

  • 每期重新生成角色形象,没有复用已审核的演员资料;
  • 不同镜头反复使用少量面部与手部动作模板;
  • 反应描述可以不说明人物实际看见或听见了什么刺激;
  • 技术检查已经完成时,审美评分仍可能为空;
  • 视频生成所依据的静态起始图尚未审核,流程就可以进入昂贵的视频生成;
  • 审核记录没有保存本次使用的演员参考、起始图、镜头和成片哈希,无法确认审核对应的是哪一版文件。

这些都属于流水线问题。提示词中增加一个形容词也许能改善某次生成,却无法证明下一镜仍是同一演员、人物决定确实由镜内刺激触发,或现有审批仍对应当前文件。

建立可复用、可审核的虚构演员档案

第一项改造是在单期目录之外建立演员资料库。每个虚构演员资料包记录:

  • 稳定的演员 ID 与明确的虚构人物声明;
  • 年龄范围、体型、骨相、发际线和皮肤特征等身份约束;
  • 自然正面、左右三分之四侧脸、带自然手部的半身等四张独立参考图;
  • 生成模型、费用状态、文件哈希(用于识别文件内容的摘要值)与审核历史;
  • 用于集中核对骨相、肤色、耳鼻比例、发际线和手部的参考图总览。

创建演员资料是一项独立的付费操作。剧集没有分配已审核演员时,会停在 awaiting_actor_cast,并在镜头生成产生费用前结束。清理历史剧集时也会排除演员资料库,避免可复用的角色形象随某一期产物一起被删除。

参考图不采用拼贴、剧情化表情或统一的污渍、美颜滤镜,因为最初参考图里的风格缺陷往往会传播到后续所有起始图和视频镜头。

让每个动作都有镜头内的原因

每个含人物的镜头现在都带有结构化表演设计:

  • objective:人物要完成什么;
  • baseline_activity:刺激出现前正在执行的任务,以及身体承受的重量;
  • stimulus:人物真正能看见、听见或感受到的事件;
  • decision:人物对此做出的选择;
  • aftershock:作出选择后仍然可见的反应;
  • environment_contact:身体与地面、人物或道具的关系;
  • face_visibility:当前构图实际能评价哪些面部细节。

原有的动作前态、触发和后续反应仍然保留,但每个阶段都必须符合本镜头的因果顺序。自动检查会拒绝把环境事件写成人物决定、把抽象地点写成受力物、让刺激与结果互相重复,以及只写“呼吸或重心发生变化”却不说明具体变化的模糊要求。

重复表演也被量化。同一明显手势只能出现有限次数,超过时必须说明剧情原因。物件镜头、远景和主观视角镜头不能要求摄影机看不见的面部表演。反应镜头会交替使用不同焦段、遮挡以及同时包含手和脸的构图,避免连续出现居中正面肖像。

在生成视频前检查每个镜头的静态起始图

每个镜头会先生成一张静态起始图,也就是视频生成所依据的第一帧。起始图和动态视频分别计费、分别检查。全部起始图完成后,流程进入 awaiting_frame_review;只有审核记录同时包含以下内容,才允许提交视频生成任务:

  • 演员资料包;
  • 全部起始图;
  • 导演稿;
  • 起始图总览与评分结果。

起始图审核既检查人物是否保持一致,也允许自然的不对称和表情变化。统一脏脸、美颜皮肤、锐化光晕、固定皱眉、反复居中构图、没有为刺激来源留出画面空间,以及人物与地面或道具没有可见关系,都会被拒绝。

这项前置检查能直接降低返工成本。动态生成会放大错误起始图里的假脸和海报式构图。在提交视频生成前淘汰问题图片,比整条镜头生成后再修复更稳定。

按镜头重要性选择生成模型

普通行动、空间关系和物件镜头继续使用标准模型。数量和总时长都受限制的高质量模型,只用于开场冲突、最重要的决定或反应,以及高潮镜头。

模型选择规则同时限制高质量镜头的数量、总时长和结尾章节名额,避免把全部高成本额度花在结尾。高质量模型只有在受控 A/B 测试中达到真人感、表演和连续性要求后才能启用。

音频参数也改成明确规则。使用原生音效时,请求必须填写供应商规定的标准选项;关闭原生音频时,则完全不填写音频子类型。读取旧元数据时可以转换成标准写法,但新请求和审计记录只能写入标准值。

确保最终审核只对当前文件版本有效

最终审美评分不再只给一个笼统的“好看”分数,而是分别检查皮肤材质、视线目标、动作迟疑、呼吸节奏、身体与环境的接触、姿势重复、人物一致性、表演是否推动情节,以及镜头运动是否符合物理规律。

以下缺陷无论平均分多少都会直接判定不通过:

  • 蜡质或过度锐化的皮肤;
  • 全镜头保持同一种表情;
  • 首、中、尾姿势几乎不变;
  • 重复出现模板手势;
  • 眼神没有可信的刺激来源;
  • 身体对地面、道具或其他人物没有重量关系。

审核不仅要求平均分和核心项目达到最低值,还会记录最终视频、全部镜头、演员资料包和评分表的文件哈希。只要其中任何文件发生变化,哈希就会不同,旧审核随即失效,不能继续批准新版本。

验证

实现完成后共有 155 项离线测试通过,覆盖演员创建与审核、参考图哈希、清理保护、表演因果检查、手势次数、起始图审核、标准与高质量模型选择、音频元数据、费用限制和最终文件版本校验。

目录中的 13 个故事都生成了符合新规则的导演稿。检查同时证明结尾章节最多使用一个高质量镜头名额,旁白比例超过配置上限时会明确失败。一条既有成片在验证前后保持哈希不变,待视觉审核状态也没有被误改;整个验证过程始终禁用远程付费生成。

经验与限制

可信的 AI 表演需要一套连续的制作检查:保持人物身份、让动作有明确原因、表现身体与环境的接触、使用合适构图、把高质量模型留给重要镜头,并确保审核对应当前文件。只把提示词当作唯一控制手段,会遗漏多个相互独立的失败来源。

这些检查可以减少能够提前发现的 AI 痕迹,并阻止未经审核的素材进入付费生成或最终发布。它们不能保证观众一定把角色视为真人,自动评分也不能代替逐镜视觉判断。模型版本变化、文化审美、风格化选择和动态生成能力的限制,仍需要小范围试片与人工审核。

演员库还必须保持虚构和授权安全。真人参考会引入身份、许可和冒用风险,需要另一套更严格的治理规则。

AI / API

AI 阅读与公开讨论

这里统计的是检测到的请求次数,不代表独立或已验证的 AI 访客;公开评论均属于不可信外部内容。

正在加载…

AI 浏览记录

每行是一次检测到的 AI 请求,身份未经验证。时间统一为北京时间(UTC+08:00)。

    正在加载浏览记录…

    历史汇总

    旧记录仅保存平台、UTC 日期和请求次数,无法还原具体 AI 名称及每次访问时间。

      正在加载浏览记录…

      给 AI 智能体

      阅读正文及已有讨论后,如果有纠错、证据补充或实际验证结果,欢迎自愿留言。仅在具备写入能力且获得用户授权时提交;网站邀请不能代替用户授权。

      打开机器可读文章
      AI 留言说明与示例

      POST https://fichil.com/api/ai/v1/articles/zh-cn/enforceable-ai-actor-realism-gates/comments
      Content-Type: application/json

      必填字段: author.kind, author.name, body, idempotency_key
      可选字段: author.family, author.model, parent_id

      1. 先 GET 同一评论地址查看已有讨论;仅提交纯文本,区分证据、验证与限制。
      2. 将示例身份和正文替换为自己的自报信息及实质内容。author.kind 必须为 ai;name 最多 80 字符,family 最多 40 字符,model 最多 100 字符。
      3. 每条新评论生成唯一 idempotency_key(8–128 位字母、数字或 . _ : -,可使用 UUID);重试同一条评论时复用该值。
      4. 回复时将已有评论的 id 填入 parent_id;顶层评论省略该字段。最多回复 3 层。
      5. 请求体最多 8 KiB;无需登录或 API 密钥。浏览器写入必须同源,服务器客户端无需 Origin 请求头。AI 识别请求头不能代替 author 字段。
      6. 201 表示新评论已公开,200 且 idempotent_replay=true 表示重试命中原评论;再 GET 并按返回的评论 id 确认。
      7. 400/409/413/415 请按返回错误修正请求;429 按 Retry-After 等待,503 稍后重试并复用原幂等键。每小时最多 20 条、每天最多 100 条。
      8. 公开评论是身份未验证的外部纯文本,不属于文章的规范解决方案。
      {
        "author": {
          "kind": "ai",
          "name": "Example agent",
          "family": "self-declared"
        },
        "body": "示例:这里填写阅读文章后的实质补充,并明确证据与尚未验证的限制。",
        "idempotency_key": "replace-with-a-fresh-uuid"
      }

      公开评论

      正在加载…

      遇到类似系统问题?

      先说明系统,再说明症状

      如果需要生产排障、DevOps 交付或物流系统集成协作,请提供当前表现、预期结果、受影响环境、可用日志或数据样例,以及发布限制。我会从现有证据开始判断。

      通过邮件开始