新浪剧评社
2026-08-12 20:54来自 其他

AI群演一集500元,3人以上群像戏却穿模错乱,真人群演为何更难被取代?

  AI群演以每集500元的成本进入短剧制作,却在3人以上群像戏中频繁出现站位错乱、肢体穿模、道具消失等问题。技术瓶颈暴露了AI在空间逻辑、人物一致性和即兴互动上的短板,也反过来印证了真人群演在复杂场景中的不可替代性。

  2026年8月,微博热搜“AI取代群演但拍不好群像”引发热议。据影视片场笔记观察,随着AI视频生成技术大规模应用,部分短剧制作方开始用AI生成背景路人以压缩成本,首批尝鲜的剧组已经遭遇集体“翻车”。话题下,网友晒出大量截图与动图:路人叠影、手臂贯穿身体、包子凭空蒸发……这些荒诞画面背后,是AI对物理世界认知的断层。

  AI群演真正的边界在哪里?我们梳理了技术逻辑、行业反馈与网友观点,尝试回答这个问题。

  为什么AI群演一遇到3人以上场景就“崩”?

  结论:当前AI模型缺乏对三维空间逻辑的理解,无法在生成时同步协调多个角色的位置、姿态和遮挡关系。这种失败并非偶然,而是技术底层架构的必然。

  AI生成图像和视频时,本质是基于概率对像素进行预测。单人背景画面,模型只需锁定一个主体,可轻松分配注意力。但当画面中出现3个以上人物,角色之间的空间关系呈指数级复杂:A的手臂搭在B的肩上,C的视线望向D,E被F遮挡了一半身体。模型需要同时计算每个人的绝对位置和相对关系,计算量从加法变成乘法。当前主流算法难以支撑这种高维约束,于是“人物位置乱跑”“两个人重影”“穿模”成为高频bug。

  网友“闻汤识面泡剧”总结:“背景人物三人以上就开始失控,人物位置乱跑,肢体穿模,道具凭空消失。”[1]另一位网友晒出全AI群演短剧片段:“路人肢体扭得像麻花,上一秒拿的包子下一秒直接凭空消失。”[2]这些直观反馈印证了技术观察:现有AI模型是“单主角思维”,无法承载群像调度。

  有人尝试用“画火柴人”的方式预先标注站位,但模型即使记住了位置,依然会忽略物理遮挡。比如两个角色擦身而过,模型可能让他们的手穿进对方的身体。空间逻辑的缺失,不是靠标注能弥补的。

  服装和面容为何难以保持一致?

  结论:角色一致性是AI生成的普遍难题,群像戏会成倍放大这种不稳定。不同镜头下,同一角色的服饰、发型、脸型可能“突变”,导致观众瞬间出戏。

  群像戏通常需要多机位、多景别捕捉。景别切换意味着模型需要重新生成像素,而AI对角色细节的记忆是“概率性”的:它没有数据库存储“这个人穿红衣服”,而是在每次生成时根据提示词和上下文重新推断。一旦画面长时间离开主体,再次出现时,模型可能自行“补脑”,把衣服花纹、颜色甚至配饰改得面目全非。

  有创作者分享经历:“模型生成的角色服饰出现不统一的细节问题,我给中国英雄头盔上生成了美国国旗,好不容易抽到衔接画面,国旗却消失了。”[3]这种对文化符号的错误拼接,恰恰说明AI不理解物体恒常性,只把它当作随机的视觉元素。在群像场景中,角色更多、细节更杂,出现“换装”的概率也更高。

  AI能复制真人演员的即兴反应吗?

  结论:不能。群像戏的灵魂,恰恰来自真人演员之间的即兴碰撞,而AI只能给出“平均化”的表演。

  一场成功的群像戏,依赖演员在瞬时互动中的情绪供养。主角的一个停顿,背景中的配角可能下意识地抬眼;一句即兴台词,会让周围人的笑容弧度发生微调。这种不可预判的现场反应,是表演艺术中最珍贵的“活气”。AI表演的本质是数据调用,它根据训练集生成“一个人在街上走”的概率形态,却无法理解“这个人听到尖叫后应该踉跄半步并抓牢手边篮子”。

  网友“wang15610183153”直言:“有时候剧本没写的小停顿、下意识的微动作,反而是人物的灵魂,这种带着小瑕疵的真实感才最戳人。”[4]另一位博主也指出:“算法追求完美可控,但好的表演恰恰需要一点‘活人瑕疵’。”[5]真人演员能从生活经验中提取细腻反应,AI只有冷冰冰的概率分布。

  更吊诡的是,AI在“过于完美”和“明显失真”之间摇摆。为了追求整洁的输出,模型会抹掉那些随机的、不完美的细节,结果人物像提线木偶,缺少呼吸感。群像戏需要的是“人群的嘈杂”,AI却给出了“标准化的背景”,于是越真实的画风,越显得古怪。

  横店群演真的会被AI取代吗?

  结论:短期内不会全面取代。AI只能替代“纯背景板”,无法替代需要情绪互动的“前景群演”。但基础群演的工作机会正在缩减。

  据微博热议,AI短剧已经让部分横店群演失业,原因是一集500元的AI群演成本远低于真人。[6]然而,这种取代仅限于不需要表情、走位和动作的虚焦路人。在需要和主角产生互动的场景,比如集市里躲避的小贩、茶馆里侧目的食客,真人依然稳如泰山。

  网友“我是大神127s_B”嘲讽:“别吹什么AI能全取代演员了,连三个背景人物的站位都控不住,还不如横店随便一个群演站得稳当。”[7]群演的“稳”,源于对实际空间的感知和对导演指令的服从。真人能在0.5秒内调整自己的位置,AI却在计算中迷失。

  当然,成本压力是真实的。对于竖屏短剧、批量生产的广告片来说,降低群演成本是刚需。AI至少能承担远景中的“人形道具”,让剧组将有限的资金投入主要演员和场景。这种取舍,短期看是博弈,长期看是分工。

  AI群演还要跨越哪些“恐怖谷”?

  结论:物理一致性和情感真实感是两大关键门槛。突破之前,AI群演只能活在远景和静态里。

  恐怖谷效应在AI群演身上体现得淋漓尽致。当AI生成的人物无限接近真人,细微的变形(如瞳孔缩放迟钝、嘴唇动作僵硬)会瞬间触发观众的反感。大银幕上,这种反感会被放大,直接影响代入感。网友“追剧音乐时尚”指出:“AI只能机械化填充空白背景,完全做不出真人路人自然松弛的神态,氛围感严重缺失。”[8]

  从技术路径看,解决这些问题需要三大升级:一是引入物理引擎,让模型理解重力、碰撞和遮挡;二是建立角色记忆库,将同一角色的外观特征以结构化方式存储;三是注入“表演语料”,用海量真人表演数据训练模型对互动的反应。但目前这三方面均无成熟方案。

  影视创作是感性与理性的交织。AI可以解决效率问题,却无法替代人与人之间的化学反应。正如微博话题下的一条高赞评论:“AI取代的是不需要表演的背景板,但真正的人群戏,多人情绪互动、空间调度,真人演员的不可替代性反而更清晰了。”[6]

  人物/角色关系表

主体身份/角色相关作品关系/经历当前关联来源
AI群演AI生成背景角色全AI短剧、AI辅助影视剧以低成本进入片场,多人场景频繁出错微博热搜“AI取代群演但拍不好群像”主要讨论对象本文整理
横店真人群演传统群众演员各类影视剧面临AI替代焦虑,但在群像戏中仍被导演依赖网友对比“不如横店群演站得稳”本文整理
导演/制片方影视制作决策者短剧、网剧等尝试用AI降本,但受困于质量,需在关键场景保留真人需评估AI与真人混合使用的成本收益本文分析
观众内容消费者对AI群演的穿帮产生出戏感社交媒体吐槽AI群演“太离谱”本文分析

  QA:关于AI群演,观众最关心的问题

  Q1:AI群演为什么总是出现道具消失、穿模等问题?

  A:因为AI模型不真正理解物体恒常性与物理规则。它生成的是“看起来像”的图像,而不是模拟真实世界运行的结果。在3人以上复杂场景中,计算量剧增,模型难以约束每个物体的位置,导致道具凭空消失或肢体穿透。

  Q2:AI会不会彻底取代横店群演?

  A:据公开讨论,AI已开始取代一些纯背景、无表演要求的群演岗位,但涉及表情互动、空间调度的群像戏,AI仍远不能胜任。目前更可能出现的是人机分工:AI负责远景和氛围,真人负责近景和互动。

  Q3:如果要用AI群像,需要注意什么?

  A:建议控制在1-2人的画面中使用AI,或作为远景静态背景。若必须展示多人互动,应尽量用真人。同时要做好角色外观统一的检查,避免不同镜头中服装突变。后期修复成本可能抵消前期节省的费用。

  AI与影视行业的碰撞还在继续。与其恐慌替代,不如看清边界。技术能填人数,填不了人味。这或许是这场热搜给行业最清醒的提醒。

  #AI取代群演但拍不好群像# #AI群演# #横店群演# #群像戏# #影视行业#