[NDC 26] NC的AI“面部动画”技术,有效降低后期处理成本
[NDC 26] 후처리 비용 줄이는 엔씨 AI의 '얼굴 애니메이션' 기술
2026.06.17 15:34 UTC+9
人工智能概要
NC AI室长张韩用于NDC 26发表演讲。介绍了自主研发的面部动画技术VARCO Face Sync。该技术能自动生成自然口型并大幅提升制作效率。

在许多游戏中,有一个虽小却常常让玩家感到不便的要素,那就是角色的台词与嘴唇动作对不上。由于很难将两者的形状完美契合,部分游戏从一开始就放弃了嘴唇动作的刻画,特别是在本地化过程中,台词与口型不一致的情况非常普遍。在生成式 AI 的时代,许多将其运用到角色面部动画制作的技术相继问世,为此举办了一场专门介绍该技术的演讲。
NC AI 物理 AI 研究所室长张韩用于 17 日星期三在 NEXON 开发者大会(NDC)26 线上活动中发表了题为《从声音到表情,利用生成式 AI 提高面部动画制作效率》的演讲。张室长解释称,随着近期游戏图形和身体动画质量的不断拉平与提升,面部动画的重要性也随之日益凸显。

过去的面部动画主要通过动作捕捉方式实现,但捕捉质量逊色于身体动作,因此必须依靠美术人员进行大量的手工修缮。虽然英伟达公开了可以替代该方案的 AI 技术,但由于基础训练数据中缺乏夸张的演戏语调或带有混响效果的游戏特有语音数据,导致嘴唇颤抖的错误时有发生。Epic Games 也公开过类似技术,作为引擎专业开发商,该技术虽然控制住了颤抖现象,但嘴唇动作表现得过于圆润细腻,存在发音被模糊或无法准确表达的局限性。这两种技术在应用于商业游戏时,都需要消耗额外的后期处理费用与时间。
张室长解释称,导致这些局限性出现的根本原因在于训练数据源本身的局限以及 AI 模型的特性。在发双唇音(ㅁ、ㅂ、ㅃ、ㅍ)时,闭合又张开嘴唇的动作未能很好地体现在 SMPL 等学习用原始数据中,从而导致成品质量下降。此外,即便是相同的发音,其语音信息与嘴唇形状也每次各不相同,若让 AI 直接照单全收进行学习,结果值就会向平均值收敛,从而生成一种如同呢喃般的模糊动画。

为了解决这些问题,NC AI 基于扩散模型训练方式(Diffusion)和 Transformer 模型开发出了能够推导出契合声音的动画结果值的“VARCO Face Sync(바르코 페이스 싱크)”。VARCO Face Sync 可以将声优配音困难的支线任务台词或 NPC 语音转换为 TTS 后自动生成动画,并且能够直接输出为虚幻引擎资源。特别是为了克服原始数据不准确的问题,他们自主开发了面部捕捉设备,直接获取双唇音数据并增加了学习量,全力以赴地将嘴唇动作还原到极致。
VARCO Face Sync 采用了将多位说话者的声音绑定为一个基准数据的检索式语音转换技术,无论输入何种声音,都能将其替换为以往学习过的清晰语音,从而有效屏蔽噪声。通过应用能够明确区分说话者的身份嵌入技术,防止了上嘴唇像男性、下嘴唇像女性这种表情本身出现异常混合的现象。考虑到表演者很难长时间保持剧烈的情感,他们有选择性地仅收集情感明确区段的数据,从而提高了情感表达的准确性。
该技术大幅减少了质量偏差并将稳定性提升至极限,无需 QA 或美术人员进行额外的后期处理,即可直接应用于商业游戏的过场动画中。由于策划人员只需将剧情脚本输入系统即可即时生成动画,从而大幅缩短了工作流程。张室长强调:“整体质量的稳定性最为重要,最重要的是为了确保这种稳定性,我们绝不能通过投入更多的人力来进行后期处理来消耗费用和时间。”

张室长列举了亟待改善的四个剩余课题。首先是利用视频生成 AI 构建训练数据的方案。因为比起真实演员的动作捕捉数据,利用视频生成 AI 制作数百小时的大量数据并筛选出所需信息进行学习,才能压倒性地提升最终动画质量。其次是利用 AI 自动生成绑定(Rig)的技术。他解释称,目前由美术人员手工实现能够做出细腻表情的绑定实在是过于复杂,导致角色的表现力边界受到了限制,因此必须由 AI 来取代这一环节。
第三是细腻的情感表达技术。由于仅凭高兴、悲伤等传统简单的情感分类无法呈现出电影级别的自然表情,因此必须利用大语言模型(LLM)对视频数据中的复杂情感导演情况进行精细的标签化,从而实现丰富多彩的表情。第四是面部与身体集成动画的自动生成。随着嘴唇动作变得自然,相对处于静止状态的眼球或尴尬的身体手势就会变得更加显眼并带来违和感,因此补充道,从长远来看,该技术应当朝着面部整体表情与身体动作能够和谐自动生成的数字孪生及数字人技术方向发展。

여러 게임에서 작은 요소지만 유저들을 불편하게 만드는 것이 바로 캐릭터의 대사와 입술 움직임이 서로 다를 때다. 둘의 모양을 맞추기가 어렵기에, 일부 게임은 처음부터 입술 움직임 묘사를 포기했으며, 특히 현지화 과정에서 대사와 입모양이 다른 경우도 많다. 생성형 AI의 시대, 이를 캐릭터 얼굴 애니메이션 제작에 활용하는 기술도 다수 발표됐는데, 이를 소개하는 강연이 열렸다.
엔씨 AI 피지컬 AI 연구소 장한용 실장은 17일 수요일 넥슨 개발자 컨퍼런스(NDC) 26 행사에서 '음성에서 표정으로, 생성AI를 이용한 얼굴 애니메이션 제작 효율화'에 대한 강연을 했다. 장 실장은 최근 게임 그래픽과 신체 애니메이션 품질 상향 평준화에 따라 얼굴 애니메이션 중요성이 커졌다고 설명했다.

과거 얼굴 애니메이션은 주로 모션 캡처 방식을 사용해 구현했으나, 캡처 품질이 신체보다 떨어져 아티스트의 수작업이 반드시 필요했다. 이를 대체할 수 있는 엔비디아 AI 기술이 공개됐지만, 과격한 연기 톤이나 울림 효과가 들어간 게임 특유의 음성 데이터가 기본 학습 데이터에 없기 때문에 입술이 떨리는 오류가 발생했다. 에픽게임즈에서도 유사한 기술을 공개했는데, 엔진 전문 개발사였던 만큼 떨림 현상은 제어했지만, 입술 움직임이 너무 부드럽게 재현돼, 발음이 뭉개지거나 정확하게 표현되지 않는 한계가 있었다. 두 기술 모두 상용게임 적용 시 별도의 후처리 비용과 시간이 소모됐다.
장 실장은 이러한 한계가 발생하는 근본적인 이유는 학습 데이터 원본의 한계와 AI 모델의 특성 때문이라고 설명했다. 양순음(ㅁ, ㅂ, ㅃ, ㅍ)을 발음할 때 입술을 닫았다가 여는 동작이 SMPL 등 학습용 원본 데이터에 제대로 구현되지 않아 결과물 품질이 떨어진다. 또한 동일한 발음이라도 음성 정보와 입술 모양이 매번 다르기 때문에, 이를 그대로 AI가 학습하면 결과값이 평균에 수렴해 웅얼거리는 듯한 애니메이션이 생성됐다.

엔씨 AI는 이런 문제점을 해결하기 위해 확산 모델 훈련 방식(디퓨전)과 트랜스포머 모델을 기반으로 음성에 맞는 애니메이션 결과값을 도출하는 '바르코 페이스 싱크'를 개발했다. 바르코 페이스 싱크는 성우 녹음이 어려운 서브 퀘스트 대사나 NPC 음성을 TTS로 변환 후 애니메이션을 자동 생성할 수 있으며, 언리얼 엔진 에셋으로도 바로 출력 가능하다. 특히 부정확한 원본 데이터 문제를 극복하기 위해 자체 얼굴 캡처 장비를 개발하여, 양순음 데이터를 직접 확보하고 학습량을 늘림으로써 입술 움직임을 최대한 재현하는 데 힘썼다.
바르코 페이스 싱크는 다수 화자 음성을 하나의 기준 데이터로 묶는 리트리벌 방식의 음성 변환 기술을 적용해, 어떤 음성이 들어와도 기존에 학습된 명확한 음성으로 치환하여 노이즈를 차단했다. 윗입술은 남자, 아랫입술은 여자처럼 표정 자체가 비정상적으로 섞이는 현상은 화자를 명확히 구분하는 아이디 임베딩 기술을 적용해 방지했다. 연기자가 오랜 시간 격한 감정을 유지하기 힘들다는 점을 고려해, 감정이 명확한 구간만 선별적으로 데이터를 수집해 감정 표현의 정확도를 높였다.
기술은 품질 편차를 줄이고 안정성을 극대화하여 QA나 아티스트의 별도 후처리 없이 상용게임 컷신에 즉시 적용됐다. 기획자가 시나리오 스크립트를 시스템에 입력하면 그 즉시 애니메이션이 생성되기 때문에 작업 공정이 크게 단축된다. 장 실장은 "전체적인 품질의 안정성이 가장 중요하고 무엇보다도 그 안정성을 확보하기 위해서 우리가 후처리를 그 인력을 더 투입해서 비용과 시간을 들이지 않는 것이 중요하다"고 강조했다.

장 실장은 개선해야 할 남은 과제로 네 가지를 꼽았다. 첫째는 영상 생성 AI를 활용해 학습 데이터를 구축하는 방안이다. 실제 배우의 모션 캡처 데이터보다 영상 생성 AI로 수백 시간 분량의 다량의 데이터를 만들고 원하는 정보만 선별해 학습시켜야 최종 애니메이션 품질을 압도적으로 높일 수 있기 때문이다. 둘째는 AI를 활용해 릭(Rig)을 자동 생성하는 기술이다. 현재 아티스트가 세밀한 표정을 짓는 릭을 수작업으로 구현하기에는 너무 복잡하여 캐릭터의 표현력 바운더리에 한계가 발생하므로, AI가 이를 대체해야 한다고 설명했다.
셋째는 세밀한 감정 표현 기술이다. 기존의 기쁨, 슬픔 등 단순한 감정 분류만으로는 영화 품질의 자연스러운 표정이 나올 수 없으므로, LLM을 활용해 영상 데이터에 복잡한 감정 디렉션 상황을 세밀하게 레이블링하여 다채로운 표정을 구현해야 한다고 설명했다. 넷째는 얼굴과 신체의 통합 애니메이션 자동 생성이다. 입술 움직임이 자연스러워지면 상대적으로 멈춰있는 눈동자나 어색한 신체 제스처가 더욱 눈에 띄어 이질감을 주기 때문에, 궁극적으로는 얼굴 전체 표정과 신체 움직임이 모두 조화롭게 자동 생성되는 디지털 트윈 및 디지털 휴먼 기술로 발전해야 한다고 덧붙였다.
这则新闻由人工智能翻译。
我将永远热爱游戏。 skyanze@gamemeca.com
推荐新闻








