“Gemini Veo 3” là cách người dùng thường gọi Veo, mô hình tạo video AI của Google, vì trước đây Veo được tích hợp trong ứng dụng Gemini. Phiên bản mới nhất hiện là Veo 3.1, có khả năng tạo video từ văn bản và hình ảnh, mô phỏng chuyển động chân thực, tạo âm thanh trực tiếp và kiểm soát nhân vật, bối cảnh tốt hơn. Vậy Veo 3.1 có gì nổi bật, dùng ở đâu và cách tạo video ra sao? Cùng Viettel Store tìm hiểu chi tiết trong bài viết dưới đây.
1. Gemini Veo 3 là gì?
“Gemini Veo 3” là cách gọi phổ biến của Veo 3, mô hình tạo video AI do Google DeepMind phát triển, xuất phát từ thời Veo còn được tích hợp trong ứng dụng Gemini. Veo 3.1 là phiên bản mới hơn, được cải thiện về khả năng kiểm soát, tính nhất quán và chất lượng video.
Lưu ý: ứng dụng Gemini hiện đã chuyển sang dùng Gemini Omni để tạo và chỉnh sửa video, thay cho Veo. Người dùng muốn dùng Veo 3.1 có thể truy cập qua Google Flow, Google Vids, Google AI Studio hoặc Gemini API.
Khác với các công cụ dựng video truyền thống, Veo cho phép người dùng mô tả ý tưởng bằng ngôn ngữ tự nhiên, sau đó AI tạo ra video dựa trên nội dung được yêu cầu. Prompt có thể bao gồm nhân vật, bối cảnh, hành động, góc máy, ánh sáng, phong cách hình ảnh và âm thanh.
Veo 3.1 hỗ trợ cả text-to-video, image-to-video và text-to-video kèm âm thanh. Người dùng cũng có thể dùng hình ảnh tham chiếu để định hướng nhân vật, vật thể hoặc phong cách của video.

Ngoài tạo video từ prompt, Google còn giới thiệu cho Veo 3.1 nhiều công cụ kiểm soát cảnh, giúp người dùng chủ động hơn thay vì chỉ tạo video một lần rồi tải xuống.
2. Gemini Veo 3 có miễn phí không? Giá và điều kiện sử dụng
Veo 3.1 không có một mức giá duy nhất, vì người dùng có thể tiếp cận mô hình qua nhiều sản phẩm của Google như Google Flow, Google Vids, Google AI Studio hoặc API. Với người dùng phổ thông, cách dễ nhất là Google Flow: tài khoản miễn phí vẫn dùng được Veo 3.1 với 50 Flow credit mỗi ngày.
2.1. Bảng giá Gemini Veo 3
Bảng giá Google AI tham khảo
|
Gói |
Giá tại Việt Nam |
Dùng Veo 3.1 qua Google Flow |
Credit/ngày |
Credit cộng thêm/tháng |
|
Không đăng ký |
Miễn phí |
Có |
50 |
– |
|
Google AI Plus |
132.000đ/tháng (4,99 USD) |
Có |
50 |
200 |
|
Google AI Pro |
489.000đ/tháng (19,99 USD) |
Có |
50 |
1.000 |
|
Google AI Ultra $100 |
Từ 2.250.000đ/tháng (99,99 USD) |
Có |
50 |
10.000 |
|
Google AI Ultra $200 |
Từ 4.500.000đ/tháng (199,99 USD) |
Có |
50 |
25.000 |
Lưu ý: Giá và quyền lợi Google AI có thể thay đổi theo quốc gia, thời điểm và chính sách của Google. Khi đăng ký, nên kiểm tra mức giá hiển thị trực tiếp trên tài khoản 
Các gói Google AI với hạn mức sử dụng Veo và Google Flow khác nhau
2.2. Gemini Veo 3 tốn bao nhiêu credit cho mỗi video?
Khi sử dụng Veo 3.1 trong Google Flow, credit được tính theo mỗi generation, không phải mỗi request. Một yêu cầu có thể tạo nhiều video nên số credit thực tế có thể cao hơn mức hiển thị cho một generation.
Bảng chi phí credit khi tạo video bằng Veo 3.1
|
Mô hình |
Thời lượng |
Credit/lượt tạo |
| Veo 3.1 Lite | 4–8 giây | 10 (gói Ultra: 5) |
| Veo 3.1 Fast | 4–8 giây | 20 (gói Ultra: 10) |
| Veo 3.1 Quality | 8 giây | 100 |
| [MỚI] Veo 3.1 Lite – chế độ ưu tiên thấp | 4–8 giây | 0, chỉ dành cho gói Ultra |
Ví dụ, một video 8 giây bằng Veo 3.1 Fast tốn 20 credit với người dùng không phải Ultra; với Veo 3.1 Quality là 100 credit.
Về độ phân giải, Google Flow cho phép nâng video lên 1080p miễn phí với gói Plus, Pro và Ultra; nâng lên 4K tốn 50 credit và chỉ dành cho Ultra.
2.3. Điều kiện tài khoản và giới hạn sử dụng
Một số điều kiện cần lưu ý:
- Độ tuổi: Google Flow yêu cầu người dùng từ 18 tuổi trở lên và tài khoản đã xác minh độ tuổi.
- Tài khoản: Quyền truy cập có thể khác nhau giữa tài khoản cá nhân và tài khoản Workspace.
- Gói dịch vụ: Một số tính năng và hạn mức cao hơn yêu cầu Google AI Plus, Pro hoặc Ultra.
- Khu vực: Việt Nam nằm trong danh sách hỗ trợ Google Flow, nhưng tính năng cụ thể có thể khác nhau theo khu vực.
- Credit: Flow credits có giới hạn theo ngày/tháng và credit chưa sử dụng không được chuyển sang chu kỳ tiếp theo.
Link truy cập: Google Flow · Google DeepMind – Veo 3.1
3. Các tính năng đột phá giúp Gemini Veo 3 “đổi cuộc chơi” tạo video
3.1. Tạo video từ văn bản và hình ảnh
Veo 3.1 hỗ trợ tạo video từ mô tả bằng văn bản và từ hình ảnh tham chiếu. Với Text-to-Video, bạn chỉ cần mô tả cảnh muốn tạo. Với Image-to-Video, hình ảnh đầu vào được dùng để định hướng nội dung video; có thể dùng ảnh nhân vật, sản phẩm hoặc bối cảnh để kiểm soát kết quả tốt hơn.

3.2. Duy trì tính nhất quán về nhân vật & bối cảnh (Character Consistency)
Một vấn đề phổ biến khi tạo video AI là nhân vật có thể thay đổi khuôn mặt, trang phục hoặc đặc điểm giữa các cảnh.
Veo 3.1 giải quyết vấn đề này bằng khả năng sử dụng hình ảnh tham chiếu nhân vật. Người dùng có thể cung cấp hình ảnh để AI duy trì diện mạo nhân vật khi tạo các cảnh khác nhau.
Tính năng này đặc biệt hữu ích khi xây dựng:
- Video kể chuyện
- Phim ngắn
- Video quảng cáo
- Nội dung có nhân vật xuyên suốt
- Video cần giữ nhận diện sản phẩm
Ngoài nhân vật, Veo còn hỗ trợ hình ảnh tham chiếu cho vật thể và phong cách, giúp các yếu tố quan trọng trong cảnh được kiểm soát nhất quán hơn.
3.3. Tạo chuyển động, góc máy và phong cách điện ảnh theo prompt
Veo 3.1 không chỉ hiểu “nhân vật đang làm gì” mà còn cho phép mô tả cách camera ghi lại hành động đó.
Một số cách mô tả phổ biến:
- Close-up: cận cảnh
- Wide shot: toàn cảnh
- Tracking shot: camera di chuyển theo nhân vật
- Push-in: camera tiến gần chủ thể
- Pan: camera lia ngang
- Tilt: camera thay đổi góc theo chiều dọc
Google cũng giới thiệu Camera Controls để kiểm soát khung hình và chuyển động camera, cùng Motion Controls để định hướng chuyển động của vật thể. Tuy nhiên, hai công cụ này không có sẵn trên mọi nền tảng.
3.4. Tạo âm thanh, hiệu ứng và hội thoại đồng bộ với video
Veo 3.1 có khả năng tạo audio native, giúp hình ảnh và âm thanh được tạo trong cùng một quá trình.
Tùy prompt, người dùng có thể yêu cầu:
- Tiếng mưa
- Tiếng bước chân
- Tiếng xe cộ
- Âm thanh môi trường
- Hiệu ứng hành động
- Hội thoại giữa các nhân vật
Google cho biết Veo 3.1 có khả năng tạo audio và cải thiện mức độ đồng bộ giữa âm thanh với nội dung hình ảnh.
Tuy nhiên, với các video có lời thoại dài hoặc yêu cầu phát âm rất chính xác, nên kiểm tra kỹ kết quả trước khi sử dụng chính thức.
3.5. Tạo và chỉnh sửa video theo nhiều cảnh
Veo 3.1 cung cấp nhiều công cụ để tiếp tục xây dựng video sau lần tạo đầu tiên.
Một số tính năng nổi bật gồm:
- Scene Extension: kéo dài cảnh từ video có sẵn
- First and Last Frame: tạo chuyển tiếp giữa hai khung hình
- Outpainting: mở rộng khung hình
- Add Object: thêm vật thể vào cảnh
- Remove Object: loại bỏ vật thể
- Motion Controls: kiểm soát chuyển động
- Character Controls: dùng cơ thể, khuôn mặt và giọng nói của bạn để điều khiển chuyển động của nhân vật.
Nhờ đó, quy trình tạo video có thể đi theo hướng: Tạo cảnh → kiểm tra → chỉnh sửa → mở rộng → kết nối thành câu chuyện thay vì chỉ tạo một video độc lập từ một prompt.
Lưu ý: không phải nền tảng nào cũng có đủ các công cụ trên. Trên Google Flow, Veo 3.1 hiện hỗ trợ Text to Video, Frames to Video (khung hình đầu/cuối), Ingredients to Video và mở rộng video (Extend). Extend chỉ thực hiện được bằng Veo 3.1 Lite, và Veo 3.1 trên Flow không chỉnh sửa được video có sẵn.
4. Hướng dẫn sử dụng Gemini Veo 3 chi tiết cho người mới
4.1. Bước 1: Truy cập nền tảng hỗ trợ Veo 3.1
Cách dễ nhất để dùng Veo 3.1 là qua Google Flow:
- Mở trình duyệt Chrome hoặc Edge trên máy tính, truy cập Google Flow và đăng nhập tài khoản Google.
- Bấm + New project để tạo dự án mới.
- Trong phần cài đặt của ô nhập prompt, chọn model Veo 3.1 (Lite, Fast hoặc Quality) và kiểm tra mức credit tương ứng.
Google Flow cũng có ứng dụng cho Android và iPhone, nhưng Google khuyến nghị dùng máy tính để có đầy đủ tính năng chỉnh sửa.

4.2. Bước 2: Chọn chế độ tạo nội dung (Tạo video từ văn bản và Tạo video từ hình ảnh)
Tạo video từ văn bản
Phù hợp khi bạn đã có ý tưởng nhưng chưa có hình ảnh tham chiếu.
Ví dụ:
Một cô gái mặc váy trắng bước chậm trên con phố Tokyo sau cơn mưa. Camera tracking từ phía sau, ánh đèn neon phản chiếu trên mặt đường ướt, phong cách điện ảnh chân thực, chuyển động tự nhiên, âm thanh mưa nhẹ và tiếng xe cộ.
Tạo video từ hình ảnh
Phù hợp khi muốn kiểm soát trước nhân vật, sản phẩm hoặc bối cảnh. Có thể tải lên hình ảnh tham chiếu và mô tả chuyển động mong muốn:
Giữ nguyên nhân vật và trang phục trong hình ảnh. Cô gái từ từ quay đầu về phía camera, tóc chuyển động nhẹ theo gió, camera tiến chậm về phía trước.
Trên Google Flow, có hai cách dùng hình ảnh: Frames to Video (dùng ảnh làm khung hình đầu, hoặc cả khung hình đầu và cuối) và Ingredients to Video (dùng ảnh làm tham chiếu cho nhân vật, vật thể, phong cách; không có ở Veo 3.1 Quality).

4.3. Bước 3: Nhập Prompt và tạo video
Một prompt Veo 3.1 cơ bản có thể xây dựng theo công thức:
Chủ thể + Bối cảnh + Hành động + Camera + Ánh sáng + Phong cách + Âm thanh
Ví dụ:
Cận cảnh một đầu bếp trẻ đang trang trí món bánh trong căn bếp hiện đại. Camera slowly pushes in, ánh sáng vàng ấm từ cửa sổ, chuyển động tay tự nhiên, phong cách quảng cáo ẩm thực cao cấp. Có tiếng dao và âm thanh nhẹ của căn bếp phía sau.
Nếu cần giữ nhân vật, có thể thêm:
Giữ nguyên khuôn mặt, kiểu tóc và trang phục của nhân vật trong hình ảnh tham chiếu. Không thay đổi nhận diện nhân vật.
Không nhất thiết phải viết prompt thật dài. Quan trọng nhất là mô tả rõ hành động, chủ thể và cách camera ghi lại cảnh.
Sau khi nhập prompt, lựa chọn model, thời lượng hoặc thiết lập phù hợp rồi tiến hành tạo video.

4.4. Bước 4: Tinh chỉnh và tải video thành phẩm
Sau khi có video, hãy kiểm tra nhân vật, khuôn mặt, trang phục, chuyển động, góc máy, âm thanh và các chi tiết bất thường. Nếu chưa đạt, có ba cách xử lý:
- Tạo lại với prompt đã chỉnh: chỉ sửa đúng yếu tố chưa ổn (ví dụ thêm “ánh sáng hoàng hôn ấm”), giữ nguyên ảnh tham chiếu hoặc khung hình đầu/cuối để kết quả không lệch quá nhiều.
- Mở rộng cảnh: dùng tính năng Extend với Veo 3.1 Lite để nối tiếp video dài 8 giây.
- Chỉnh sửa trực tiếp trên video: chuyển sang model Gemini Omni Flash ngay trong Flow để yêu cầu thay đổi bằng câu lệnh.
Để tải video: di chuột lên video, chọn More → Download rồi chọn định dạng. Người dùng gói Plus trở lên có thể nâng video lên 1080p miễn phí trước khi tải.

5. So sánh Gemini Veo 3.1 với Runway Gen-3, Luma Dream Machine & OpenAI Sora
Veo 3.1 và Gemini Omni Flash là hai model tạo video của Google, cùng có mặt trên Google Flow nhưng mạnh ở những việc khác nhau:
|
Tiêu chí |
Veo 3.1 |
Gemini Omni Flash |
| Thời lượng mỗi lần tạo | 4–8 giây | 4–10 giây |
| Text-to-Video | Có | Có |
| Khung hình đầu/cuối | Có | Có |
| Ảnh tham chiếu (Ingredients) | Có ở Lite và Fast, không có ở Quality | Có |
| Chỉnh sửa video có sẵn | Không | Có |
| Mở rộng video trên Flow | Có (dùng Veo 3.1 Lite) | Sắp ra mắt |
| Dùng trên ứng dụng Gemini | Không (đã được Omni thay thế) | Có |
| Credit cho video 8 giây trên Flow | 10 (Lite), 20 (Fast), 100 (Quality) | 12 (720p) |
Nói ngắn gọn: Veo 3.1 phù hợp khi cần một cảnh quay chất lượng cao, mở rộng thành chuỗi cảnh và kiểm soát bằng khung hình đầu/cuối; Gemini Omni Flash phù hợp khi cần chỉnh sửa video qua nhiều lượt hội thoại. Google tập trung khá mạnh vào tính nhất quán, âm thanh native và khả năng kiểm soát cảnh của Veo, đồng thời đưa các tính năng này vào Google Flow để hỗ trợ quy trình tạo video nhiều cảnh.
Ngoài hệ sinh thái Google, các công cụ như Runway hay Luma cũng hỗ trợ tạo video từ văn bản, hình ảnh và dùng ảnh tham chiếu. Tính năng và model của các nền tảng này thay đổi rất nhanh, nên người dùng nên thử cùng một ý tưởng trên từng công cụ trước khi chọn gói trả phí.
6. Review Gemini Veo 3.1: Ưu và nhược điểm
6.1. Ưu điểm của Gemini Veo 3.1
- Bám sát prompt tốt: Google cho biết Veo 3.1 được cải thiện về khả năng hiểu và thực hiện chính xác yêu cầu trong prompt. Đây là yếu tố quan trọng khi người dùng muốn kiểm soát hành động, camera hoặc phong cách của cảnh.
- Chất lượng hình ảnh và chuyển động cao: Veo 3.1 được Google thiết kế để tạo video có độ chân thực cao, bao gồm chuyển động và mô phỏng vật lý trong cảnh.
- Hỗ trợ âm thanh native: Người dùng có thể tạo video cùng âm thanh môi trường, hiệu ứng và hội thoại thay vì phải tạo audio hoàn toàn bằng công cụ bên ngoài.
- Khả năng giữ nhân vật và bối cảnh: Hình ảnh tham chiếu, Ingredients to Video và Character Controls giúp người dùng kiểm soát nhân vật, vật thể và phong cách xuyên suốt quá trình tạo video.
- Nhiều công cụ kiểm soát cảnh: Khung hình đầu/cuối, mở rộng cảnh cùng các công cụ khác (xem mục 3.5) giúp người dùng chủ động hơn sau lần tạo đầu tiên.
6.2. Nhược điểm của Gemini Veo 3.1
- Credit và giới hạn sử dụng: Nếu tạo video thường xuyên, người dùng cần quan tâm đến credit. Trong Google Flow, mỗi model Veo 3.1 có mức credit khác nhau; Quality tốn 100 credit mỗi lượt, gấp 5–10 lần Lite hoặc Fast.
- Không còn dùng trực tiếp trên ứng dụng Gemini: Người dùng phải chuyển sang Google Flow hoặc các nền tảng khác để dùng Veo, và mỗi nền tảng lại có bộ tính năng khác nhau.
- Kết quả vẫn phụ thuộc prompt: Những cảnh có quá nhiều hành động hoặc yêu cầu mâu thuẫn vẫn có thể cho kết quả chưa chính xác.
- Âm thanh hội thoại vẫn có giới hạn: Theo trang giới thiệu Veo của Google DeepMind, lời thoại tự nhiên và nhất quán, đặc biệt với những đoạn nói ngắn, vẫn là lĩnh vực đang được phát triển.
- Không chỉnh sửa trực tiếp được video trên Flow: Muốn thay đổi video đã tạo, người dùng phải tạo lại hoặc chuyển sang Gemini Omni Flash.
- Có watermark: Video được gắn watermark ẩn SynthID; người dùng tại Việt Nam còn bị gắn watermark hiển thị tự động khi tạo trên Google Flow.

7. Câu hỏi thường gặp về Gemini Veo 3
7.1. Veo 3.1 có hỗ trợ tạo video tiếng Việt không?
Veo 3.1 có thể xử lý prompt bằng ngôn ngữ tự nhiên, trong đó người dùng có thể mô tả cảnh bằng tiếng Việt. Tuy nhiên, nếu video yêu cầu hội thoại tiếng Việt, chất lượng phát âm, ngữ điệu và độ chính xác của lời thoại có thể thay đổi tùy nội dung.
Với video cần lời thoại chính xác, nên kiểm tra kỹ audio sau khi tạo. Google cũng cho biết tính nhất quán của lời thoại tự nhiên vẫn là một giới hạn đang được cải thiện.
7.2. Có thể dùng video tạo bằng Veo 3.1 để kiếm tiền YouTube/TikTok không?
Có thể sử dụng video AI cho nội dung trên YouTube, TikTok hoặc các nền tảng khác, nhưng việc được phép kiếm tiền hay không phụ thuộc vào chính sách hiện hành của từng nền tảng, tính nguyên bản của nội dung và quyền sử dụng các tài sản được đưa vào video.
Video tạo bằng Veo được gắn watermark ẩn SynthID để nhận diện nội dung AI. Nếu tạo trên Google Flow tại Việt Nam, video còn có watermark hiển thị. Nên khai báo nội dung AI theo yêu cầu của từng nền tảng trước khi thương mại hóa.
7.3. Tại sao tài khoản của tôi chưa sử dụng được Veo 3.1?
Một số nguyên nhân thường gặp:
- Đang tìm Veo trên ứng dụng Gemini, trong khi ứng dụng này đã chuyển sang dùng Gemini Omni.
- Tài khoản chưa đủ 18 tuổi hoặc chưa xác minh độ tuổi.
- Khu vực chưa được hỗ trợ.
- Tài khoản Workspace có giới hạn riêng.
- Đã hết credit hoặc hạn mức trong ngày/tháng.
- Đang trong giờ cao điểm (khoảng 21h–24h giờ Việt Nam), khi tài khoản không đăng ký có thể không tạo được video.
Nếu dùng Google Flow, có thể kiểm tra model đang chọn và mức credit ngay trong phần cài đặt của ô nhập prompt.
7.4. Có thể sử dụng Veo 3.1 trên điện thoại không?
Có. Google Flow có ứng dụng cho Android và iPhone/iPad, Việt Nam nằm trong khu vực hỗ trợ, và Project được đồng bộ với bản máy tính. Tuy nhiên, một số tính năng như Flow Agent và Tools chỉ có trên web, nên Google vẫn khuyến nghị dùng máy tính với trình duyệt Chrome để chỉnh sửa đầy đủ.
Veo 3.1, thường được tìm với tên “Gemini Veo 3”, hướng đến việc biến ý tưởng bằng văn bản hoặc hình ảnh thành video có hình ảnh, chuyển động và âm thanh trong cùng một quy trình. Với người mới, cách đơn giản nhất là vào Google Flow, tạo một cảnh ngắn từ prompt bằng Veo 3.1 Lite hoặc Fast, rồi dùng hình ảnh tham chiếu, khung hình đầu/cuối hoặc mở rộng cảnh khi cần kiểm soát nhiều hơn. Giá, credit và quyền truy cập có thể thay đổi theo thời điểm, gói Google AI và khu vực, vì vậy nên kiểm tra thông tin trực tiếp trên Google trước khi sử dụng.
Email của bạn sẽ không được hiển thị công khai. Các trường bắt buộc được đánh dấu *
Tạo bình luận mới