텍스트 한 줄로 영상 편집부터 생성까지. 구글이 멀티모달 AI 기반 영상 생태계 경쟁에 본격적으로 뛰어들었다.
구글이 연례 개발자 행사 ‘구글 I/O 2026’에서 새로운 멀티모달 AI 모델 ‘제미나이 옴니 플래시(Gemini Omni Flash)’를 공개했다.
이번 모델은 텍스트·이미지·오디오·영상 입력을 동시에 이해하고, 이를 기반으로 고품질 영상을 생성하거나 편집할 수 있는 것이 핵심이다.
구글은 제미나이 옴니를 “추론 능력과 창작 능력을 결합한 AI”라고 설명했다. 지난해 공개된 이미지 생성 AI ‘나노 바나나(Nano Banana)’의 후속 모델 성격도 가진다.
가장 주목받는 기능은 자연어 기반 영상 편집이다.
사용자가 단순히 “거울을 액체처럼 흔들리게 만들어줘”, “불빛을 음악 리듬에 맞춰 깜빡이게 해줘” 같은 문장을 입력하면 AI가 이를 영상에 그대로 반영한다.
특히 편집이 누적 방식으로 작동한다는 점이 차별점이다. 이전 프롬프트의 맥락을 유지한 채 추가 수정이 가능해 캐릭터 일관성과 물리 표현이 유지된다.
구글은 이번 모델이 단순 패턴 생성 수준을 넘어 ‘물리 세계’를 이해한다고 강조했다.
중력과 운동 에너지, 유체 흐름 같은 요소를 직관적으로 반영해 더 자연스러운 장면을 구현할 수 있다는 설명이다.
예를 들어 단백질 접힘 같은 과학 개념도 클레이 애니메이션 형식으로 시각화할 수 있다. 단순 생성 AI가 아니라 교육·과학 콘텐츠 영역까지 겨냥한 셈이다.
업계가 가장 주목하는 부분은 ‘유튜브 쇼츠 무료 제공’이다.
구글은 제미나이 옴니 플래시를 유튜브 쇼츠와 유튜브 크리에이트 앱에서도 무료로 활용할 수 있도록 공개했다.
이는 단순 기능 공개가 아니라 크리에이터 생태계 확보 전략으로 해석된다.
틱톡과 인스타그램 릴스가 장악한 숏폼 시장에서, AI 기반 영상 제작 도구를 무기로 유튜브 플랫폼 경쟁력을 강화하려는 움직임이라는 분석이 나온다.
이번 발표는 AI 경쟁 무대가 이미지 생성에서 영상 생성으로 이동하고 있음을 보여준다.
현재 영상 AI 시장은 오픈AI의 ‘소라(Sora)’, 바이트댄스의 ‘시던스(Seedance)’, 그리고 구글 제미나이 옴니 플래시까지 다자 경쟁 구도로 빠르게 재편되고 있다.
특히 구글은 단순 생성보다 ‘대화형 편집’을 강조하며 차별화를 시도하고 있다.
이미 존재하는 영상 소재를 AI로 수정하고 강화하려는 실사용자 수요가 훨씬 크다는 판단 때문이다.
업계에서는 이번 기술이 광고·교육·게임·콘텐츠 산업 전반에 큰 영향을 줄 것으로 보고 있다.
AI가 영상 제작 과정 상당 부분을 자동화하면서 제작 비용과 시간, 인력 구조 자체가 바뀔 가능성이 크기 때문이다.
특히 숏폼 크리에이터와 유튜버, 마케터 입장에서는 전문 영상 편집 기술 없이도 고품질 콘텐츠 제작이 가능해질 전망이다.
AI 영상 경쟁은 단순히 새로운 영상을 만드는 단계를 넘어 사용자가 가진 콘텐츠를 얼마나 쉽게 수정하고 확장할 수 있느냐로 이동하고 있다.
구글이 제미나이 옴니 플래시를 통해 강조한 것도 바로 이 지점이다.
앞으로 영상 AI 시장의 승자는 ‘가장 현실적인 제작 경험’을 제공하는 플랫폼이 될 가능성이 높다.