[NDC 26] ポストプロセス費用を削減するNCのAI「顔面アニメーション」技術
[NDC 26] 후처리 비용 줄이는 엔씨 AI의 '얼굴 애니메이션' 기술
2026.06.17 15:34 UTC+9
AIの概要
NC AIが音声から自然な口の動きを自動生成する技術を開発しました。独自の顔キャプチャー装備を活用してリップシンクの精度を高めています。QAなどの後処理コストを削減し商用ゲームへの即時適用を実現しました。

多くのゲームにおいて、細かい要素ではあるがユーザーを不快にさせるのが、まさにキャラクターのセリフとリップシンクが一致していない時だ。両者の形状を合わせるのが難しいため、一部のゲームでは最初からリップシンクの描写を諦めており、特にローカライズの過程でセリフと口の動きが異なるケースも多い。生成AIの時代を迎え、これをキャラクターの顔アニメーション制作に活用する技術も多数発表されたが、これらを紹介する講演が行われた。
NC AIピジカルAI研究所のチャン・ハンヨン室長は17日水曜日、NEXON開発者カンファレンス(NDC)26のイベントにて、「音声から表情へ、生成AIを利用した顔アニメーション制作の効率化」に関する講演を行った。チャン室長は、最近のゲームグラフィックと身体アニメーション品質の向上に伴い、顔アニメーションの重要性が高まっていると説明した。

過去の顔アニメーションは主にモーションキャプチャー方式を使用して実装されていたが、キャプチャー品質が身体よりも劣り、アーティストの手作業が必須であった。これを代替できるNVIDIAのAI技術が公開されたが、過激な演技トーンや反響効果が入ったゲーム特有の音声データが基本の学習データに含まれていないため、唇が震えるエラーが発生した。Epic Gamesからも類似の技術が公開されたが、エンジン専門の開発会社であっただけに震え現象は制御したものの、リップシンクが滑らかに再現されすぎてしまい、発音が潰れたり正確に表現されなかったりする限界があった。両技術ともに商用ゲームに適用する際、別途の後処理費用と時間がかかった。
チャン室長は、このような限界が発生する根本的な理由は、学習データの元の限界とAIモデルの特性にあると説明した。両唇音(ㅁ、ㅂ、ㅃ、ㅍ)を発音する際、唇を閉じてから開ける動作がSMPLなどの学習用元データにきちんと実装されていないため、結果物の品質が低下する。また、同じ発音であっても音声情報とリップシンクが毎回異なるため、これをそのままAIが学習すると結果値が平均に収束し、もぐもぐと喋るようなアニメーションが生成された。

NC AIはこうした問題を解決するため、拡散モデルの訓練方式(ディフュージョン)とトランスフォーマーモデルを基盤に、音声に合わせたアニメーション結果値を導き出す「VARCO Face Sync」を開発した。「VARCO Face Sync」は声優の収録が難しいサブクエストのセリフやNPCの音声をTTSに変換した後、アニメーションを自動生成することが可能であり、Unreal Engineのアセットとしても直接出力できる。特に不正確な元データの問題を克服するため、独自の顔キャプチャー装備を開発し、両唇音データを直接確保して学習量を増やすことで、リップシンクの最大限の再現に努めた。
「VARCO Face Sync」は、多数の話者の音声をひとつの基準データにまとめるリトリーバル方式の音声変換技術を適用し、どのような音声が入ってきても既存に学習された明確な音声に置換してノイズを遮断した。上唇は男性、下唇は女性のように表情自体が異常に混ざる現象は、話者を明確に区別するID埋め込み技術を適用して防止した。演技者が長時間の激しい感情を維持するのが困難である点を考慮し、感情が明確な区間のみ選別的にデータを収集して感情表現の精度を高めた。
本技術は品質の偏差を減らし安定性を極大化することで、QAやアーティストによる別途の後処理なしに商用ゲームのカットシーンに即座に適用された。企画者がシナリオスクリプトをシステムに入力するとその場でアニメーションが生成されるため、作業工程が大幅に短縮される。チャン室長は、「全体的な品質の安定性が最も重要であり、何よりもその安定性を確保するために私たちが後処理にその人手をさらに投入して費用と時間をかけないことが重要である」と強調した。

チャン室長は、改善すべき残りの課題として4つを挙げた。第1は、映像生成AIを活用して学習データを構築する方策である。実際の俳優のモーションキャプチャーデータよりも、映像生成AIで数百時間分に及ぶ大量のデータを作り、必要な情報だけを選別して学習させなければ、最終的なアニメーション品質を圧倒的に高めることができないからである。第2は、AIを活用してリグ(Rig)を自動生成する技術である。現在、アーティストが細かい表情を作るリグを手作業で実装するにはあまりにも複雑であり、キャラクターの表現力の境界に限界が生じるため、AIがこれを代替しなければならないと説明した。
第3は、細かい感情表現技術である。従来の喜び、悲しみなどの単純な感情分類だけでは映画品質の自然な表情が出ないため、LLMを活用して映像データに複雑な感情ディレクション状況を高精度にラベリングし、多彩な表情を実装しなければならないと説明した。第4は、顔と身体の統合アニメーションの自動生成である。リップシンクが自然になると、相対的に止まっている瞳や不自然な身体ジェスチャーが一層目立って違和感を与えるため、究極的には顔全体の表情と身体の動きがいずれも調和して自動生成されるデジタルツインおよびデジタルヒューマン技術へと発展しなければならないと付け加えた。

여러 게임에서 작은 요소지만 유저들을 불편하게 만드는 것이 바로 캐릭터의 대사와 입술 움직임이 서로 다를 때다. 둘의 모양을 맞추기가 어렵기에, 일부 게임은 처음부터 입술 움직임 묘사를 포기했으며, 특히 현지화 과정에서 대사와 입모양이 다른 경우도 많다. 생성형 AI의 시대, 이를 캐릭터 얼굴 애니메이션 제작에 활용하는 기술도 다수 발표됐는데, 이를 소개하는 강연이 열렸다.
엔씨 AI 피지컬 AI 연구소 장한용 실장은 17일 수요일 넥슨 개발자 컨퍼런스(NDC) 26 행사에서 '음성에서 표정으로, 생성AI를 이용한 얼굴 애니메이션 제작 효율화'에 대한 강연을 했다. 장 실장은 최근 게임 그래픽과 신체 애니메이션 품질 상향 평준화에 따라 얼굴 애니메이션 중요성이 커졌다고 설명했다.

과거 얼굴 애니메이션은 주로 모션 캡처 방식을 사용해 구현했으나, 캡처 품질이 신체보다 떨어져 아티스트의 수작업이 반드시 필요했다. 이를 대체할 수 있는 엔비디아 AI 기술이 공개됐지만, 과격한 연기 톤이나 울림 효과가 들어간 게임 특유의 음성 데이터가 기본 학습 데이터에 없기 때문에 입술이 떨리는 오류가 발생했다. 에픽게임즈에서도 유사한 기술을 공개했는데, 엔진 전문 개발사였던 만큼 떨림 현상은 제어했지만, 입술 움직임이 너무 부드럽게 재현돼, 발음이 뭉개지거나 정확하게 표현되지 않는 한계가 있었다. 두 기술 모두 상용게임 적용 시 별도의 후처리 비용과 시간이 소모됐다.
장 실장은 이러한 한계가 발생하는 근본적인 이유는 학습 데이터 원본의 한계와 AI 모델의 특성 때문이라고 설명했다. 양순음(ㅁ, ㅂ, ㅃ, ㅍ)을 발음할 때 입술을 닫았다가 여는 동작이 SMPL 등 학습용 원본 데이터에 제대로 구현되지 않아 결과물 품질이 떨어진다. 또한 동일한 발음이라도 음성 정보와 입술 모양이 매번 다르기 때문에, 이를 그대로 AI가 학습하면 결과값이 평균에 수렴해 웅얼거리는 듯한 애니메이션이 생성됐다.

엔씨 AI는 이런 문제점을 해결하기 위해 확산 모델 훈련 방식(디퓨전)과 트랜스포머 모델을 기반으로 음성에 맞는 애니메이션 결과값을 도출하는 '바르코 페이스 싱크'를 개발했다. 바르코 페이스 싱크는 성우 녹음이 어려운 서브 퀘스트 대사나 NPC 음성을 TTS로 변환 후 애니메이션을 자동 생성할 수 있으며, 언리얼 엔진 에셋으로도 바로 출력 가능하다. 특히 부정확한 원본 데이터 문제를 극복하기 위해 자체 얼굴 캡처 장비를 개발하여, 양순음 데이터를 직접 확보하고 학습량을 늘림으로써 입술 움직임을 최대한 재현하는 데 힘썼다.
바르코 페이스 싱크는 다수 화자 음성을 하나의 기준 데이터로 묶는 리트리벌 방식의 음성 변환 기술을 적용해, 어떤 음성이 들어와도 기존에 학습된 명확한 음성으로 치환하여 노이즈를 차단했다. 윗입술은 남자, 아랫입술은 여자처럼 표정 자체가 비정상적으로 섞이는 현상은 화자를 명확히 구분하는 아이디 임베딩 기술을 적용해 방지했다. 연기자가 오랜 시간 격한 감정을 유지하기 힘들다는 점을 고려해, 감정이 명확한 구간만 선별적으로 데이터를 수집해 감정 표현의 정확도를 높였다.
기술은 품질 편차를 줄이고 안정성을 극대화하여 QA나 아티스트의 별도 후처리 없이 상용게임 컷신에 즉시 적용됐다. 기획자가 시나리오 스크립트를 시스템에 입력하면 그 즉시 애니메이션이 생성되기 때문에 작업 공정이 크게 단축된다. 장 실장은 "전체적인 품질의 안정성이 가장 중요하고 무엇보다도 그 안정성을 확보하기 위해서 우리가 후처리를 그 인력을 더 투입해서 비용과 시간을 들이지 않는 것이 중요하다"고 강조했다.

장 실장은 개선해야 할 남은 과제로 네 가지를 꼽았다. 첫째는 영상 생성 AI를 활용해 학습 데이터를 구축하는 방안이다. 실제 배우의 모션 캡처 데이터보다 영상 생성 AI로 수백 시간 분량의 다량의 데이터를 만들고 원하는 정보만 선별해 학습시켜야 최종 애니메이션 품질을 압도적으로 높일 수 있기 때문이다. 둘째는 AI를 활용해 릭(Rig)을 자동 생성하는 기술이다. 현재 아티스트가 세밀한 표정을 짓는 릭을 수작업으로 구현하기에는 너무 복잡하여 캐릭터의 표현력 바운더리에 한계가 발생하므로, AI가 이를 대체해야 한다고 설명했다.
셋째는 세밀한 감정 표현 기술이다. 기존의 기쁨, 슬픔 등 단순한 감정 분류만으로는 영화 품질의 자연스러운 표정이 나올 수 없으므로, LLM을 활용해 영상 데이터에 복잡한 감정 디렉션 상황을 세밀하게 레이블링하여 다채로운 표정을 구현해야 한다고 설명했다. 넷째는 얼굴과 신체의 통합 애니메이션 자동 생성이다. 입술 움직임이 자연스러워지면 상대적으로 멈춰있는 눈동자나 어색한 신체 제스처가 더욱 눈에 띄어 이질감을 주기 때문에, 궁극적으로는 얼굴 전체 표정과 신체 움직임이 모두 조화롭게 자동 생성되는 디지털 트윈 및 디지털 휴먼 기술로 발전해야 한다고 덧붙였다.
このニュースはAIによって翻訳されました。
ゲームを常に愛していきます。 skyanze@gamemeca.com
おすすめニュース
最も人気のあるニュース
- 深まるスネージナヤの危機、「原神」Ver.7.1が23日より開始
- [TGS 26] キム・ヨンハ「パレイドリア、激しさの代わりに心地よさを込めた」
- [本日のSteam] 正常化したFPS新作WAR DOGS、同時接続者数42万人を突破
- [TGS 26] グローバルイベントへ飛躍する、東京ゲームショウ2026開幕
- グランド・セフト・オートVIのオンラインは最大32人プレイをサポート、訴訟文書で判明
- 4人の英雄と共に繰り広げる群像劇、ファイアーエムブレム 万紫千紅
- [TGS 26] 1周年アップデートを控えたアウタープレイン、単独ブースを予告
- [TGS 26] グラビティ、ラグナロクのコンソールプロジェクトを公開
- [TGS 26] 特区庁名刺ケース、アストラエ・オラティオ来場者特典公開
- ポケモンディレクター新作、天気連動ゲーム「雨のち晴れ少女」








