음성 AI가 사람과 대화할 수 있게 된 뒤에도 남은 문제는 많습니다. 답을 찾기 위해 잠시 멈추는 순간, 사용자는 시스템이 듣고 있는지 작업 중인지 알기 어렵습니다.
Google은 9월 24일 Gemini 3.8 Live with Live Avatar를 발표했습니다. 실시간 영상과 음성을 결합하고, 배경에서 도구를 호출하는 동안에도 대화를 이어가는 기능을 Gemini Enterprise에 제공하겠다는 내용입니다.
표정과 음성으로 작업 상태 표시
Live Avatar는 사용자의 음성과 시각 정보를 함께 받아 실시간으로 반응하는 시각적 상대처럼 응답합니다. Google은 입 모양 동기화, 표정, 자연스러운 발화 순서를 핵심 경험으로 제시했습니다.
고객 응대나 안내 화면에서는 아바타의 표정과 음성으로 시스템이 듣는 중인지, 정보를 찾는 중인지, 답변을 준비하는지 표시할 수 있습니다.
표정과 입 모양의 자연스러움은 답변의 내용과 별개로 시스템이 살아 있는 듯한 인상을 만듭니다. 이 인상은 대기 시간을 덜 어색하게 할 수 있지만, 실제로 무엇이 진행 중인지를 설명하는 신호가 함께 있어야 합니다.
배경에서 도구를 호출하며 대화 유지
Google은 비동기 도구 호출*을 통해 Live Avatar가 정보를 찾거나 외부 작업을 진행하는 동안에도 대화를 계속할 수 있다고 설명했습니다. 발표에서는 호텔 체크인처럼 여러 단계를 거치는 요청을 예로 들었습니다.
도구 호출 시간이 사라지는 것은 아니지만, 사용자는 빈 로딩 화면 대신 현재 작업 상태를 대화와 아바타 반응으로 확인할 수 있습니다.
비동기 도구 호출은 대화를 끊지 않는 장점이 있지만 사용자에게는 결과가 언제 나오는지 알기 어렵게 만들 수 있습니다. 그래서 대화를 이어가는 말과 별도로, 도구가 시작됐는지·대기 중인지·완료됐는지를 명시하는 흐름이 필요합니다.
Gemini Enterprise에 우선 제공
영상 아바타는 음성만 있는 에이전트보다 더 강한 존재감을 만듭니다. 그만큼 사용자는 시스템이 실제 사람인지, 어떤 정보를 처리하고 있는지, 외부 도구를 통해 무엇을 바꾸는지를 더 명확히 알아야 합니다. Google은 출력물에 SynthID 워터마크를 적용한다고 밝혔습니다.
아바타가 대화를 이어줘도 실제 처리 속도와 완료를 혼동하게 해서는 안 됩니다. 도구 호출·결과 대기·실패 상태를 언어와 시각 신호로 구분하고, 카메라와 마이크의 사용 시점, 생성물의 출처를 분명히 표시해야 합니다.
특히 고객 응대처럼 사람이 실제 상담원으로 오해할 수 있는 장면에서는 AI임을 알리는 표기와 사람에게 넘기는 경로가 눈에 띄어야 합니다. 친밀한 상호작용일수록 자연스러움과 투명성은 함께 설계돼야 합니다.
D.Flick Note
Gemini Live Avatar는 도구 호출 중에도 음성·영상 대화를 이어가는 기능을 Gemini Enterprise에 제공합니다. 실제 적용에서는 아바타의 표정이 현재 작업 상태와 정확히 일치하는지 확인해야 합니다.
References
- 비동기 도구 호출: AI가 외부 서비스나 기능의 처리 결과를 기다리는 동안에도 대화나 다른 작업을 계속하는 방식입니다.