비 오는 카페 영상을 만든다고 해 보자. 창밖의 빗방울과 커피잔만 그럴듯하면 되는 것이 아니다. 실내에서 듣는 빗소리인지, 음악이 깔리는지, 잔을 내려놓는 순간 소리가 맞는지에 따라 장면의 인상이 달라진다. 영상 생성 모델을 사용할 때도 화면과 소리를 함께 기획하면 무엇을 수정해야 하는지 분명해진다.
Veo는 Google DeepMind의 영상 생성 모델 계열이다. 공식 소개는 Veo 3.1을 다루며, 영상과 함께 대사·환경음·효과음을 생성하는 기능을 설명한다. Flow는 이런 모델을 선택하고 장면을 제작하는 서비스다. 두 이름을 구분해야 모델의 기능과 편집 도구의 기능을 혼동하지 않는다. Veo 공식 소개
이 글은 2026년 10월 4일 확인한 공식 문서를 바탕으로 Veo 3.1을 Flow에서 활용하는 방법을 설명한다. 아래 프롬프트와 제작안은 편집팀의 예시이며, 실제 생성 결과나 모델 간 성능 측정치는 아니다.

영상과 오디오를 함께 기획하는 과정을 표현한 AI 생성 설명 이미지입니다. Veo의 실제 출력 화면은 아닙니다.
Flow에 들어가면 먼저 선택 모델을 확인한다
Flow에서 프로젝트를 만들고, 입력창의 모델 메뉴에서 Video를 선택한다. 사용할 모델, 화면비, 길이, 출력 개수를 확인한 다음 장면을 설명하고 Generate를 실행한다. 이미지로 시작하려면 Frames에서 시작 이미지를 넣고 이미지 이후의 움직임을 적는다. Flow 영상 생성 안내
Flow에는 Veo 외 모델도 있으므로 화면에서 사용할 수 있는 기능을 전부 Veo의 능력으로 받아들이면 안 된다. 확인한 도움말에서 Veo 3.1의 지원 범위는 다음처럼 구분된다.
| Flow의 선택 모델 | 텍스트·시작 프레임·시작/끝 프레임 | 참조 재료로 생성 | 영상 연장 |
|---|---|---|---|
| Veo 3.1 Lite | 4·6·8초 | 8초 | 지원 조건에 맞는 Veo 클립 |
| Veo 3.1 Fast | 4·6·8초 | 8초 | 해당 모델에서 미지원 |
| Veo 3.1 Quality | 4·6·8초 | 미지원 | 해당 모델에서 미지원 |
도움말은 영상 연장에 Lite를 사용하도록 안내한다. 또 기존 영상을 프롬프트로 수정하는 Video to Video는 위 Veo 세 모델의 지원 기능으로 표시하지 않는다. 생성 직전 활성 모델과 크레딧을 확인하는 이유다. 이 표는 Flow 기준이며 API 전체 사양표가 아니다. 모델별 지원 기능
한 컷에 하나의 중심 행동을 정한다
첫 실습으로는 사건이 많이 일어나는 장면보다 분위기와 작은 움직임을 가진 컷이 적합하다. “카페에 들어와 주문하고 커피를 마신 뒤 밖으로 나간다”를 한 번에 요구하면 입장, 손동작, 인물 이동, 장면 전환을 모두 검토해야 한다.
대신 컷의 목적을 “비 오는 날의 차분한 분위기를 보여 주는 도입부”로 정해 보자. 피사체는 커피잔, 움직임은 증기와 빗방울, 카메라는 느린 전진, 소리는 유리창에 닿는 비로 제한할 수 있다.
장면: 해 질 무렵 작은 카페. 창가의 나무 테이블에 도자기 커피잔이 놓여 있다.
행동: 잔에서 가느다란 증기가 올라오고 창밖에는 비가 내린다.
카메라: 잔을 향해 천천히 가까워지는 하나의 연속된 숏.
조명: 실내의 따뜻한 조명과 창밖의 차가운 푸른빛.
오디오: 유리창에 닿는 부드러운 빗소리와 낮은 실내 환경음.
음악과 대사 없이 주변 소리만 들린다.
이 예시는 작성 양식일 뿐 특정 길이나 움직임의 정확한 재현을 보장하지 않는다. 길이와 화면비는 프롬프트만 믿지 말고 생성 설정에서도 지정한다.
소리를 세 층으로 나눠 쓰면 수정 지점이 보인다
오디오 요청은 배경, 사건, 대사로 나눠 생각할 수 있다. 배경은 공간을 계속 채우는 소리이고, 사건은 물체가 닿거나 문이 열릴 때 생기는 소리다. 대사는 발화자와 문장이 정확해야 하는 별도 과제다.
| 소리의 역할 | 카페 장면의 예 | 검토할 점 |
|---|---|---|
| 배경 | 창밖 빗소리, 실내의 작은 울림 | 장면 내내 공간감이 유지되는가 |
| 사건 | 찻잔을 받침에 내려놓는 소리 | 보이는 접촉 시점과 맞는가 |
| 대사 | 바리스타의 짧은 한 문장 | 말한 내용과 입 움직임이 맞는가 |
처음에는 배경음만 확인하고, 다음 시도에서 사건 하나를 추가하는 식으로 접근할 수 있다. 대사와 음악까지 한꺼번에 바꾸면 어떤 요청이 결과에 영향을 줬는지 알기 어렵다. 특정 발음이나 정확한 문구가 납품 조건이라면 생성 음성을 그대로 채택하기 전에 별도 녹음·후반 편집과 비교해 보는 편이 낫다.
좋은 한 컷을 얻었으면 다음 컷과의 연결을 설계한다
도입 컷 다음에 커피잔의 가까운 화면을 붙인다면 잔의 형태, 손잡이 방향, 빛의 색이 이어져야 한다. 예쁜 결과를 각각 고르는 것만으로는 하나의 장면처럼 보이지 않을 수 있다.
Flow에서는 영상의 프레임을 이미지로 저장해 후속 생성의 재료나 시작·끝 프레임으로 사용할 수 있다. Scenebuilder에서는 여러 클립의 순서를 정하고 앞뒤를 다듬어 장면을 구성할 수 있다. 장면 편집 공식 안내
편집팀이 권하는 작업 방식은 선택한 컷의 끝 부분을 먼저 검토한 뒤 다음 컷의 시작 구도를 정하는 것이다. 카메라가 오른쪽으로 움직이던 장면 뒤에 반대 방향의 움직임을 붙일 것인지, 의도적인 정지 컷으로 호흡을 끊을 것인지 결정한다. 연장 기능도 무조건 길게 만드는 용도보다 기존 행동을 조금 더 이어야 할 때 검토한다.
실패한 결과는 화면과 소리를 따로 기록한다
“이상하게 나왔다” 대신 원인을 나눠 적으면 다음 요청을 줄일 수 있다. 컵의 형태는 맞는데 카메라가 너무 빨랐다면 카메라만 수정한다. 영상은 쓸 만한데 효과음 시점이 어긋났다면 전체 장면 재생성과 오디오 후반 작업 중 어느 쪽이 적은 수고인지 판단한다.
최종 검토에서는 첫 프레임뿐 아니라 중간과 마지막 프레임, 그리고 실제 재생 속도의 오디오를 확인한다. 컷이 연결되는 지점의 음량 변화도 중요하다. 소리가 갑자기 끊기면 같은 공간이라는 느낌이 깨진다.
도구 선택 자체가 고민이라면 AI 영상 제작 도구 비교에서 입력 자료와 작업 목적을 기준으로 후보를 좁힐 수 있다.
자주 묻는 질문
Veo와 Flow는 같은 서비스인가?
Veo는 모델 계열이고 Flow는 모델을 이용해 영상을 만드는 제작 서비스다. Flow에서 선택한 모델과 모드가 무엇인지 확인해야 한다.
Quality를 고르면 모든 기능을 쓸 수 있나?
그렇지 않다. 확인한 Flow 지원표에는 참조 재료와 연장 등에서 모델별 차이가 있다. 이름만 보고 기능이 모두 포함된다고 판단하지 않는다.
소리가 함께 생성되면 편집이 필요 없나?
대사, 효과음 타이밍, 컷 사이 음량은 여전히 확인해야 한다. 동시 생성은 작업의 출발점이며 최종 음향 검수를 대신하지 않는다.
긴 영상을 만들려면 한 번에 많은 행동을 적어야 하나?
이 가이드에서는 컷별로 필요한 행동을 정하고 연결하는 방식을 권한다. 장면 목적과 검토 기준이 명확해져 수정할 범위를 좁히기 쉽다.
한눈에 정리
- Veo 모델의 능력과 Flow 편집 기능을 구분한다.
- 생성 직전 모델, 길이, 화면비, 크레딧을 확인한다.
- 화면에는 중심 행동 하나, 소리에는 역할별 지시를 담는다.
- 다음 컷의 시작을 이전 컷의 끝과 연결해 설계한다.
- 생성된 소리도 영상과 별도로 검토한다.