먼저 결론: 옴니 1.1 플래시는 ‘영상 생성·편집 모델’입니다
Gemini Omni 1.1 Flash는 텍스트 답변용 Gemini Flash와 이름은 비슷하지만 역할이 다릅니다. Google이 2026년 8월 공개한 공식 모델 코드는 gemini-omni-1.1-flash이며, 텍스트·이미지·영상을 입력받아 영상을 만들거나 수정하는 모델입니다. 짧은 영상을 대화하듯 고치고, 장면을 이어 붙이고, 첫 프레임과 마지막 프레임 사이의 움직임을 생성하는 데 초점이 맞춰져 있습니다.
‘4K 지원’도 맞습니다. 다만 처음부터 네이티브 4K로 생성한다는 뜻은 아닙니다. 공식 API 문서에는 1080p와 4K가 업스케일 출력으로 표시돼 있습니다. 화질 선택이 가능하다는 사실과 원본 생성 해상도는 구분해서 봐야 합니다.
| 항목 | 공식 확인 내용 |
|---|---|
| 모델 | gemini-omni-1.1-flash 안정 버전 |
| 입력 | 텍스트·이미지·영상, 편집·연장용 영상은 최대 10초 |
| 출력 | 3~10초 영상, 초당 24프레임 |
| 화면 비율 | 가로 16:9 기본, 세로 9:16 선택 |
| 해상도 | 360p·720p·1080p·4K, 1080p와 4K는 업스케일 |
| 주요 기능 | 텍스트·이미지 기반 생성, 대화형 편집, 장면 연장, 시작·종료 프레임 보간 |
새로 추가된 핵심 기능 네 가지
1. 앞 장면을 참고해 영상을 최대 40초까지 연장
장면 연장은 기존 영상의 마지막 부분을 바탕으로 다음 장면을 생성하는 기능입니다. Google 설명에 따르면 옴니 1.1은 이전 영상 문맥을 최대 10초까지 분석하고, 10초 단위로 연장해 누적 40초까지 이어갈 수 있습니다. 인물이나 공간의 연속성을 유지하면서 카메라 이동이나 다음 행동을 지시할 때 유용합니다.
2. 시작 프레임과 종료 프레임 사이를 연결
첫 이미지와 마지막 이미지를 지정하면 두 장면 사이의 움직임을 생성합니다. 단순한 슬라이드 전환이 아니라 카메라가 회전하거나 줌인하는 흐름, 처음과 끝이 맞물리는 반복 영상처럼 중간 동작이 필요한 장면에 적합합니다.
3. 360p로 빠르게 시험하고 최종본만 고해상도로 출력
360p 초안은 표준 720p보다 빠르고 저렴하게 여러 구성을 비교하기 위한 옵션입니다. Google은 360p 출력이 720p보다 최대 60% 빠르고 비용은 약 3분의 1이라고 설명합니다. 처음부터 4K로 여러 번 생성하기보다 구도와 동작을 낮은 해상도로 확정한 뒤 최종 시안만 1080p나 4K로 올리는 방식이 합리적입니다.
4. 자연어로 생성 결과를 이어서 수정
Interactions API에서는 이전 생성 결과를 문맥으로 유지한 채 ‘카메라를 더 천천히 이동’, ‘배경은 유지하고 인물의 동작만 변경’처럼 후속 지시를 보낼 수 있습니다. 매번 프롬프트를 처음부터 다시 쓰지 않아도 되지만, 수정할 때도 인물의 얼굴이나 사물 형태가 완전히 고정된다고 보장되지는 않습니다.
어디에서 사용할 수 있나
- Google AI Studio·Gemini API: 개발자가 모델을 직접 시험하거나 자동화에 연결하는 경로. API는 일반
generateContent가 아니라 Interactions API 예제를 기준으로 확인해야 합니다. - Google Flow: Google AI Plus·Pro·Ultra 구독자에게 전 세계적으로 제공되는 영상 제작 도구.
- Gemini 앱: Plus·Pro·Ultra 구독자는 장면 연장 기능을 이용할 수 있습니다. Flow와 API의 모든 세부 제어가 Gemini 앱에 그대로 제공된다는 뜻은 아닙니다.
따라서 ‘제미나이 구독만 있으면 API도 무료인가’라는 질문에는 아니라고 답해야 합니다. 개인용 구독과 개발자 API 청구는 별도입니다.
AI Studio에서 시험할 때 권장 순서
- Google AI Studio에서 모델 이름이
gemini-omni-1.1-flash인지 확인 - 첫 시안은 360p 또는 기본 720p, 화면 비율은 목적에 맞춰 16:9나 9:16 선택
- 한 번에 여러 동작을 넣지 말고 인물·행동·카메라·조명 순서로 프롬프트 구성
- 동작과 구도가 정해진 뒤 시작·종료 프레임이나 장면 연장 기능 적용
- 마지막 시안만 1080p 또는 4K 업스케일로 출력해 세부 왜곡 확인
프롬프트는 ‘멋진 영상’처럼 추상적으로 쓰기보다 ‘실내 전시장, 한 인물, 카메라는 오른쪽으로 천천히 이동, 장면 전환 없음’처럼 요소를 분리하는 편이 결과 비교에 좋습니다. 동일한 조건에서 한 요소만 바꿔야 어떤 지시가 결과에 영향을 줬는지도 확인할 수 있습니다.
비용은 어느 정도인가
2026년 8월 29일 공식 Gemini API 요금표 기준으로 Omni 1.1 Flash는 무료 티어가 없고 유료 티어에서 제공됩니다. 표준 720p 출력은 초당 약 0.10달러에 해당합니다. 단순 계산하면 10초 영상 한 번의 출력 비용은 약 1달러이지만, 입력 처리와 반복 생성, 고해상도 출력 방식에 따라 실제 청구액은 달라질 수 있습니다.
비용을 줄이려면 360p로 3~4개 시안을 만들고 한 요소씩 비교한 뒤 최종 후보 하나만 고해상도로 출력하는 방식이 안전합니다. 자동 재시도 횟수와 일일 호출 상한도 함께 설정해야 예상치 못한 반복 비용을 막을 수 있습니다.
결과를 볼 때는 화질보다 먼저 이것을 확인해야 합니다
최신 텍스트-영상 평가 연구는 단순한 선명도만으로 모델 성능을 판단하기 어렵다고 지적합니다. WACV 2026의 T2VWorldBench는 1,200개 프롬프트를 이용해 현실성, 문장과 영상의 관련성, 시간적 일관성, 세계 지식 반영을 함께 평가했습니다. 이 연구가 Omni 1.1을 직접 판정한 것은 아니지만, 생성 영상을 검수할 때 필요한 기준은 분명히 보여 줍니다.
- 프롬프트 일치: 요청한 인물 수, 방향, 사물과 행동이 실제로 들어갔는지
- 시간적 연속성: 프레임 사이에서 얼굴·손·물체 형태가 갑자기 바뀌지 않는지
- 물리적 자연스러움: 걷기, 충돌, 반사, 그림자 같은 움직임이 현실 규칙과 맞는지
- 편집 연속성: 장면을 연장했을 때 색감, 인물 의상, 카메라 방향이 유지되는지
- 고해상도 오류: 4K 업스케일 뒤 작은 글자나 손가락, 경계선의 왜곡이 더 눈에 띄지 않는지
Omni 1.1 Flash는 빠른 초안 제작과 자연어 편집, 장면 연장을 한 흐름으로 묶었다는 점이 강점입니다. 반면 ‘4K’ 표기만 보고 완성도를 가정하거나, 첫 결과를 사실적인 영상으로 곧바로 사용하는 것은 위험합니다. 낮은 해상도로 구조를 정하고 최종 출력에서 움직임과 세부 오류를 다시 확인하는 과정까지 포함해야 실무 도구로 쓸 수 있습니다.
공식 지원 안내
지원 대상과 설정 조건은 업데이트될 수 있습니다. 적용 전 공식 안내를 확인하세요.
확인한 자료
- Gemini Omni Flash model card · Google AI for Developers
- Gemini Omni 1.1 Flash lets you build with more control · Google
- Generate and edit videos with Gemini Omni Flash · Google AI for Developers
- Gemini Developer API pricing · Google AI for Developers
- T2VWorldBench: A Benchmark for Evaluating World Knowledge in Text-to-Video Generation · WACV 2026
편집·검수 안내 · 운영자가 공식 자료와 핵심 사실을 확인한 뒤 게시했습니다. 자료 정리와 초안 작성에는 생성형 AI를 활용했습니다. 정보 확인 기준 2026년 8월 29일.


