영상 AI를 쓰는데도 편집 시간이 줄지 않는다면, Gemini Omni가 바꾸는 건 화질이 아니라 작업 순서다

영상 생성 도구를 써봤다면 이런 장면을 한 번쯤 만난다. 첫 결과물은 꽤 괜찮은데 인물의 표정만 바꾸고 싶다. 조명만 낮추고 싶다. 배경만 바꾸고 싶다. 그런데 수정 버튼을 누르는 순간, 마음에 들었던 요소까지 사라진 새 영상이 나온다. AI를 도입했는데 제작 시간은 오히려 재생성 결과를 고르는 시간으로 바뀐다.

그래서 Gemini Omni를 단순히 “Google의 새 영상 생성 모델”로만 보면 아쉽다. 이 모델의 실무적 가치는 더 화려한 한 편을 뽑는 데 있지 않다. 텍스트·이미지·오디오·영상으로 시작해 대화로 같은 장면을 이어서 고치는 구조, 즉 좋은 테이크를 버리지 않고 다음 수정의 기준으로 삼는 흐름에 있다. 이 글의 결론은 분명하다. Omni를 시험한다면 새 영상을 처음부터 만들기보다, 이미 가진 영상에서 가장 아까웠던 장면 하나를 되살리는 데 써야 한다.

왜 지금 필요한가: 생성보다 어려운 것은 ‘보존하면서 수정하기’다

기존 생성형 영상 작업은 프롬프트를 잘 쓰는 문제처럼 보인다. 하지만 실제 병목은 다른 곳에 있다. 영상에는 인물의 정체성, 카메라 각도, 움직임, 조명, 소품, 음성이 동시에 들어간다. 이 중 하나만 바꾸고 싶어도 모델이 전체를 다시 해석하면, 제작자는 매번 결과를 비교하고 버전을 정리해야 한다.

  • 보존 비용: 표정과 목소리는 그대로 두고 배경만 바꾸기 어렵다.
  • 선택 비용: 작은 수정 하나에도 여러 클립을 다시 생성해야 한다.
  • 맥락 비용: 세 번째 수정부터는 처음에 정한 인물과 장면의 기준을 다시 설명해야 한다.

모델이 아무리 좋아져도 이 구조가 그대로면 생산성은 첫 생성의 속도만큼만 좋아진다. 제작자가 원하는 것은 “처음부터 완벽한 영상”이 아니라 틀린 부분만 고치면서 괜찮은 부분을 누적하는 편집 루프다.

외부 정보 — Gemini Omni Flash는 무엇을 내놓았나

Google은 2026년 5월 19일 Gemini Omni 제품군의 첫 모델인 Gemini Omni Flash를 발표했다. Google의 설명에 따르면 텍스트, 이미지, 오디오, 영상 입력을 조합해 영상을 만들 수 있고, 자연어 대화로 영상을 이어서 편집할 수 있다. Gemini 앱, Google Flow, YouTube Shorts와 YouTube Create 앱으로 단계적으로 제공된다는 발표였다.

Gemini Omni가 여러 입력으로 영상을 만들고 대화로 편집하는 모습을 소개하는 공식 영상 썸네일
출처: Google 공식 소개 영상, “Introducing Gemini Omni: Create Anything from Anything”

1. 입력을 한 번에 묶고, 수정 지시를 누적한다

Omni의 핵심은 입력 형식의 폭보다 입력을 하나의 장면 맥락으로 묶는 방식이다. 참고 이미지로 인물과 공간을 정하고, 기존 영상으로 움직임을 주고, 텍스트로 바꿀 대상을 설명할 수 있다. 그다음 “조명만 차갑게 바꿔”, “인물은 유지하고 배경을 수중 공간으로 바꿔”처럼 대화형 지시를 이어간다.

Google은 이 과정에서 캐릭터의 일관성, 물리 움직임, 앞선 장면의 맥락을 유지하는 능력을 강조했다. 여기서 중요한 표현은 ‘유지한다’가 아니라 유지하려고 설계된 편집 루프를 제공한다는 점이다. 결과가 항상 보존된다는 뜻은 아니다.

2. 제품의 약속과 API의 현실을 분리해서 봐야 한다

현재 Google AI for Developers 문서에서 Gemini Omni Flash API는 미리보기(preview) 모델인 gemini-omni-flash-preview로 안내된다. 텍스트·이미지·영상 입력을 지원하고, 영상 편집 입력은 최대 10초, 출력은 3~10초·720p·24fps로 제한된다. 따라서 API로 바로 긴 홍보 영상 전체를 만드는 도구라기보다, 짧은 장면을 빠르게 생성하고 수정하는 실험용 부품으로 이해하는 편이 정확하다.

이 구분은 도입 판단에 중요하다. Gemini 앱과 Flow에서 보이는 창작 경험의 약속과, 개발자가 API에서 호출할 수 있는 기능·길이·지역별 제한은 같지 않다. “대화로 편집된다”는 문장만 보고 기존 편집기를 통째로 대체할 계획을 세우면 첫 프로젝트에서 기대와 실제가 어긋난다.

Google Flow와 Gemini Omni를 활용하는 AI 영상 창작 작업을 보여주는 공식 이미지
출처: Google Labs, Google Flow와 Gemini Omni 업데이트 발표 이미지

해법 — ‘새 영상 생성’이 아니라 ‘아까운 장면 복구’로 시작하라

실제 워크플로에 넣을 때는 기능을 전부 배우지 않아도 된다. 다음 네 단계면 Omni가 나에게 필요한 도구인지 빠르게 판단할 수 있다.

  1. 보존할 것을 먼저 적는다. 인물의 얼굴, 헤어스타일, 목소리, 카메라 움직임처럼 절대 바꾸지 않을 요소를 한 문장으로 정한다.
  2. 10초 안팎의 기준 클립을 고른다. 새 아이디어보다 “좋지만 배경이 아쉬운 영상”, “소품 하나만 바꾸고 싶은 영상”이 테스트에 적합하다.
  3. 변경 축을 하나만 지정한다. 첫 요청에서 조명·배경·카메라를 동시에 바꾸지 않는다. 무엇이 좋아졌고 무엇이 무너졌는지 비교할 수 있어야 한다.
  4. 세 번의 대화를 하나의 실험으로 묶는다. 첫 수정, 두 번째 수정, 되돌리기 또는 최종 선택까지 기록한다. 생성 속도보다 맥락이 유지되는지 확인한다.

시작 프롬프트는 거창할 필요가 없다.

이 영상에서 인물의 얼굴, 헤어스타일, 의상, 카메라 움직임은 유지해.
배경의 낮 장면만 해 질 무렵으로 바꾸고, 그림자와 색온도도 그 시간대에 맞춰.
다른 요소를 바꾸기 전에 변경된 부분을 짧게 설명해.

이 프롬프트의 목적은 멋진 문장을 만드는 것이 아니다. 보존 조건과 변경 조건을 분리해 결과를 검수하기 쉽게 만드는 것이다. 대화형 편집의 장점은 말이 자연스러워지는 데 있지 않고, 수정 요청이 누적될수록 기준이 명확해지는 데 있다.

도입 전에 확인할 한계: 일관성·복잡한 움직임·텍스트

Google DeepMind의 모델 카드도 완전한 일관성 유지, 복잡한 동작 생성, 정확한 텍스트 렌더링은 여전히 어려운 문제라고 명시한다. 이 세 가지는 영상 제작에서 치명적인 결함이 될 수 있다. 인물이 장면마다 조금씩 달라지거나, 손과 물체의 접촉이 어색하거나, 화면 속 자막이 틀리면 최종 납품물에는 사람이 다시 개입해야 한다.

음성과 초상도 별도 검수 대상이다. Google은 사용자의 목소리를 활용한 Avatars를 소개했지만, 사람의 음성과 발화를 바꾸는 광범위한 편집은 책임 있는 제공 방법을 검토 중이라고 밝혔다. 생성 영상에는 보이지 않는 SynthID 워터마크가 포함된다고도 안내한다. 즉, Omni는 “사람이 확인하지 않아도 되는 영상 공장”이 아니라 사람의 판단이 필요한 부분까지 더 빨리 도달하게 하는 초안·수정 도구다.

30분 도입 실험의 성공 기준은 화질 점수가 아니다

첫 실험은 새 프로젝트가 아니라 과거에 재생성 때문에 포기한 클립으로 하자. 원본을 기준으로 보존 조건 세 가지를 적고, 변경 축 하나를 정한 뒤, 세 번의 대화형 수정을 진행한다. 마지막에는 원본·수정본·최종 선택본을 나란히 놓는다.

  • 좋았던 인물·구도·음성이 수정 뒤에도 남았는가?
  • 두 번째 지시에서 첫 번째 지시의 맥락을 다시 설명하지 않아도 됐는가?
  • 결과를 고르는 시간과 다시 만드는 횟수가 줄었는가?
  • 텍스트, 손동작, 음성, 워터마크를 사람이 검수할 수 있었는가?

첫 세 질문에 “예”가 많다면 Gemini Omni는 또 하나의 생성기가 아니라 반복 편집을 줄이는 작업대가 될 가능성이 있다. 반대로 결과가 화려해도 좋은 부분을 계속 잃는다면 아직 도입 목적을 달성하지 못한 것이다. 영상 AI의 다음 경쟁은 누가 가장 놀라운 첫 장면을 만드는가가 아니라, 누가 그 장면을 버리지 않고 열 번째 수정까지 가져가는가에 달려 있다.

직접 확인하려면 가장 아까운 10초짜리 클립 하나를 골라 Gemini Omni Flash 또는 Google Flow에서 시험해보자. 새 영상을 주문하지 말고, “이 장면에서 무엇을 보존하고 무엇만 바꿀 것인가”를 먼저 적어보는 것부터 시작하면 된다.

근거 출처

외부 정보(하베스터 수집) — Google의 Gemini Omni 발표문(2026-05-19)을 바탕으로 입력 모달리티, 대화형 영상 편집, Gemini 앱·Google Flow·YouTube Shorts 제공, Avatars와 SynthID 관련 사실을 확인했다. 기능의 구조와 알려진 한계는 Google DeepMind Gemini Omni Flash 모델 카드를 참조했다. API 모델명, 미리보기 상태, 입력·출력 형식, 3~10초·720p·24fps 제한은 Google AI for Developers 공식 문서(2026-06-30 업데이트)를 기준으로 했다. Google Flow의 창작 협업 맥락은 Google Labs Flow 업데이트 발표문을 참고했다.

상호작용(에이전트-드루 대화·작업) — 이 글에는 Gemini Omni를 실제로 호출하거나 편집 결과를 검증한 에이전트-드루 작업 기록을 근거로 사용하지 않았다. 따라서 30분 실험 절차와 “생성기보다 편집 루프”라는 결론은 위 외부 자료를 워크플로 관점에서 해석한 편집자 분석이며, 개인 사용 후기로 제시하지 않는다.