- Trang chủ
- GIỚI THIỆU
- TƯ VẤN CHIẾN LƯỢC
- TRIỂN KHAI ĐA KÊNH
- ĐÀO TẠO AI MARKETING
- TIN TỨC
- CẨM NANG
- LIÊN HỆ
Công cụ AI tạo video từ văn bản là phần mềm nhận mô tả bằng chữ rồi sinh ra đoạn video kèm âm thanh. Tính đến 03/09/2026, Sora của OpenAI đã đóng cửa từ 26/04/2026, còn Veo 3.1 của Google tạo 8 giây mỗi lượt và có thể nối dài tới khoảng 148 giây.
Bài viết này giúp bạn nắm được công cụ nào còn dùng được, giá bao nhiêu, khác nhau ra sao và doanh nghiệp Việt Nam phải gắn nhãn thế nào theo quy định mới. Số liệu lấy từ tài liệu chính thức của Google Cloud, OpenAI Help Center và văn bản pháp luật Việt Nam, cập nhật ngày 03/09/2026.
Mô hình nhận một đoạn mô tả bằng chữ, dự đoán chuỗi khung hình khớp với mô tả đó, rồi ghép thành video. Các model mới còn sinh luôn âm thanh nền và lời thoại đồng bộ.
Người dùng chỉ cần gõ prompt. Nhưng chất lượng đầu ra phụ thuộc vào cách mô tả góc máy, chủ thể, hành động và bối cảnh. Prompt mơ hồ cho ra video mơ hồ.
Có hai kiểu đầu vào chính. Text-to-video nhận thuần chữ. Image-to-video nhận thêm ảnh gốc để giữ đúng sản phẩm hoặc gương mặt. Artificial Analysis duy trì hai bảng xếp hạng riêng cho hai bài toán này vì kết quả dẫn đầu không giống nhau.
Sora là mô hình tạo video của OpenAI, ra mắt tháng 12/2024, đã ngừng hoạt động. App và web đóng ngày 26/04/2026, API ngừng hoàn toàn ngày 24/09/2026.
Sora bản đầu cho phép tạo video tối đa 1080p, dài 20 giây, đi kèm gói ChatGPT Plus. Sora 2 ra mắt ngày 30/09/2025 dưới dạng app di động độc lập kiêm mạng xã hội, bổ sung khả năng sinh âm thanh và hội thoại đồng bộ.
Ngày 24/03/2026, OpenAI thông báo dừng sản phẩm với thông điệp ngắn gọn trên X. Lý do công ty đưa ra là dồn nguồn lực tính toán cho hướng nghiên cứu mô phỏng thế giới phục vụ robotics. Cùng thời điểm, thỏa thuận nội dung trị giá 1 tỷ USD với Disney cũng dừng lại.
Điều này có ý nghĩa thực tế với marketer. Nếu bạn đang đọc một bài hướng dẫn "cách dùng Sora tạo video quảng cáo", bài đó đã lỗi thời. Sau ngày 24/09/2026, mọi endpoint API trả lỗi và các link video cũ sẽ hỏng nếu chưa tải về máy.
Đừng xây quy trình sản xuất nội dung phụ thuộc vào một công cụ AI duy nhất. Một sản phẩm có hậu thuẫn tài chính mạnh, cộng đồng đông và hợp đồng bản quyền lớn vẫn bị khai tử trong sáu tháng. Hãy lưu bản gốc video và prompt ở nơi bạn kiểm soát được.
Veo là dòng mô hình tạo video của Google DeepMind, bản mới nhất là Veo 3.1 kèm hai biến thể Fast và Lite. Veo sinh video có âm thanh đồng bộ, truy cập qua Gemini app, Google Flow, Gemini API và Vertex AI.
Giới hạn độ dài là điểm nhiều bài viết tiếng Việt nói sai. Tài liệu kỹ thuật của Google Cloud ghi rõ mỗi lượt tạo cho ra video 4, 6 hoặc 8 giây. Mức 1080p và 4K bắt buộc chọn 8 giây. Con số "60 giây" xuất hiện trên nhiều blog tổng hợp không khớp với tài liệu gốc.
Muốn video dài hơn, bạn dùng tính năng extend. Veo 3.1 và Veo 3.1 Fast nối thêm khoảng 7 giây mỗi lần, tối đa khoảng 20 lần, tổng đạt gần 148 giây. Bản Lite không hỗ trợ extend.
Tài liệu Gemini API cập nhật ngày 30/06/2026 khuyến nghị dùng Gemini Omni Flash làm model tạo video mặc định. Google nêu lý do là độ mạch lạc hình ảnh tốt hơn, giữ nhân vật nhất quán hơn và cho phép chỉnh sửa qua nhiều lượt hội thoại.
Veo 3.1 được khuyến nghị cho các nhu cầu riêng: nối dài cảnh, điều khiển khung hình cuối hoặc tích hợp vào quy trình cũ. Nếu bạn mới bắt đầu, thử Gemini Omni Flash trước rồi mới cân nhắc Veo.
Tài liệu Vertex AI ghi ngôn ngữ prompt được hỗ trợ cho Veo 3.1 là tiếng Anh. Model vẫn có thể phản hồi prompt tiếng Việt, nhưng đó không phải cấu hình được Google cam kết. Với nội dung có lời thoại tiếng Việt, hãy thử nghiệm kỹ khẩu hình trước khi đưa vào chiến dịch thật.
Không có công cụ tốt nhất tuyệt đối. Các bảng xếp hạng Artificial Analysis và VBench cho thứ tự khác nhau tùy tiêu chí chấm.
| Công cụ | Trạng thái 09/2026 | Độ dài mỗi lượt | Sinh âm thanh | Giá khởi điểm |
|---|---|---|---|---|
| Sora 2 (OpenAI) | Đã ngừng, API tắt 24/09/2026 | Tối đa 20 giây khi còn hoạt động | Có | Không còn bán |
| Veo 3.1 (Google) | Đang hoạt động | 4, 6 hoặc 8 giây, extend tới ~148 giây | Có | 0,05 USD/giây qua Gemini API (bản Lite) |
| Gemini Omni Flash | Google khuyến nghị làm mặc định | Theo tài liệu Gemini API | Có | Theo bảng giá Gemini API |
| Kling 3.0 (Kuaishou) | Đang hoạt động | Chưa công bố rõ theo giây | Có ở bản Pro và Omni | Khoảng 5,99 USD/tháng |
| Runway Gen-4 | Đang hoạt động | Tùy gói | Có ở gói Pro | Khoảng 12 USD/tháng |
| Hailuo 2.3 (MiniMax) | Đang hoạt động | 6 đến 10 giây | Có | Khoảng 9,99 USD/tháng |
| Wan 3.0 (Alibaba) | Đang hoạt động | Chưa công bố | Tùy biến thể | Chưa có giá tiêu dùng công khai |
Trên bảng Elo bình chọn mù của Artificial Analysis ngày 03/09/2026, nhóm dẫn đầu hạng mục text-to-video có âm thanh gồm Gemini Omni Flash, Wan 3.0 và MiniMax H3 Max. Veo 3.1 xếp khoảng hạng 13. Xếp hạng thay đổi liên tục nên hãy kiểm tra lại trước mỗi đợt chọn công cụ.
Text-to-video cho tự do sáng tạo nhưng khó kiểm soát ngoại hình. Image-to-video giữ đúng sản phẩm, logo và gương mặt nhờ ảnh gốc, đổi lại chuyển động camera bị hạn chế hơn.
Chọn text-to-video khi bạn cần brainstorm ý tưởng, dựng cảnh nền b-roll hoặc chưa có tài sản hình ảnh nào. Đây cũng là lựa chọn hợp lý cho các cảnh không có nhân vật, ví dụ chai nước hoa xoay trên nền đá cẩm thạch.
Chọn image-to-video khi thương hiệu cần nhất quán. Video quảng cáo sản phẩm e-commerce là ví dụ rõ nhất. Sai một chi tiết bao bì là khách nhận ra ngay.
Google còn khuyến nghị cách làm lai: dùng model tạo ảnh dựng khung hình đầu, rồi đưa vào Veo với tính năng first and last frame để tạo chuyển động. Cách này cho mức kiểm soát cao nhất trong ba phương án.
Với Gemini API tính theo giây, một clip 8 giây có âm thanh dao động khoảng 0,4 đến 4,8 USD tùy chọn bản Lite, Fast hay Standard và tùy độ phân giải.
Bảng giá Gemini API cho Veo 3.1 ghi Lite 0,05 USD mỗi giây ở 720p, Fast 0,10 USD mỗi giây ở 720p và Standard 0,40 USD mỗi giây ở 720p hoặc 1080p. Bản 4K của Standard là 0,60 USD mỗi giây.
Đây mới là chi phí một lần tạo thành công. Thực tế bạn phải tính thêm số lần thử. Một cảnh có chuyển động camera phức tạp hoặc nhiều nhân vật thường cần vài chục lượt mới ra bản dùng được.
Kinh nghiệm ngân sách đơn giản: nhân chi phí một lượt với 10 rồi lấy đó làm mức sàn cho một cảnh hoàn chỉnh. Nếu con số vẫn thấp hơn báo giá quay dựng truyền thống thì mới cân nhắc tiếp. Với video có người thật nói tiếng Việt, chênh lệch này thường không lớn như quảng cáo của các công cụ.
Nếu bạn cần đội ngũ dựng quy trình sản xuất nội dung ổn định thay vì thử từng công cụ, tham khảo dịch vụ sản xuất nội dung của Vinalink.
Công thức Google Cloud khuyến nghị cho Veo 3.1 gồm năm phần: kiểu quay, chủ thể, hành động, bối cảnh và phong cách. Thiếu phần kiểu quay là nguyên nhân phổ biến nhất khiến video ra sai ý.
Tài liệu Vertex AI liệt kê các loại chuyển động camera có thể gọi tên trong prompt: static, pan, tilt, dolly in hoặc out, truck, pedestal và zoom. Gọi đúng tên kỹ thuật cho kết quả ổn định hơn nhiều so với mô tả chung chung kiểu "quay đẹp".
Một prompt mẫu theo cấu trúc này: cảnh cận, ánh sáng vàng hoàng hôn, nhân viên pha chế rót latte art vào cốc thủy tinh trên quầy gỗ, máy quay dolly-in chậm, phong cách quay điện thoại chân thực, âm thanh có tiếng rót và nhạc jazz nhẹ.
Vài nguyên tắc rút gọn từ tài liệu chính thức của cả OpenAI và Google:
Nếu đội in-house của bạn cần được huấn luyện bài bản về prompt và quy trình kiểm duyệt nội dung AI, Vinalink có chương trình đào tạo AI in-house theo đặc thù từng phòng ban.
Nghị định 142/2026/NĐ-CP có hiệu lực từ 01/05/2026 buộc bên triển khai gắn nhãn dễ nhận biết cho video AI trong hai trường hợp: mô phỏng ngoại hình hoặc giọng nói người thật, và tái hiện sự kiện thực tế.
Nghị định này hướng dẫn thi hành Luật Trí tuệ nhân tạo số 134/2025/QH15, có hiệu lực từ 01/03/2026. Quy định gắn nhãn nằm tại Điều 18. Nhãn phải rõ ràng, dễ nhận biết và hiển thị trước hoặc tại thời điểm người xem tiếp cận nội dung.
Hình thức gắn nhãn được chấp nhận khá linh hoạt: hiển thị trực tiếp trên video, đặt ở tiêu đề hoặc phần mô tả, hiển thị trên giao diện nền tảng, hoặc phát thông báo bằng âm thanh.
Một số trường hợp được miễn gắn nhãn, gồm chỉnh sửa kỹ thuật để nâng chất lượng hình ảnh mà không đổi bản chất nội dung, nội dung chỉ dùng nội bộ và nội dung trong quá trình nghiên cứu chưa công khai.
Nhiều doanh nghiệp hiểu nhầm rằng quy định này chỉ áp cho công ty công nghệ. Thực tế, mọi tổ chức dùng AI để làm quảng cáo hay chatbot đều là bên triển khai và phải tuân thủ. Bên cạnh đó, TikTok, Meta và YouTube đều có yêu cầu khai báo nội dung AI riêng cho quảng cáo.
Rủi ro lớn nhất của video AI không nằm ở kỹ thuật mà ở cảm nhận thương hiệu. Người xem phản ứng mạnh khi thấy AI thay thế con người trong nội dung vốn cần cảm xúc hoặc tay nghề thủ công.
Chuỗi ví dụ trong hai năm qua khá nhất quán. Coca-Cola dựng lại quảng cáo Giáng sinh bằng AI và bị chê vô hồn. Gucci đăng ảnh AI quảng bá show Milan tháng 02/2026 và hứng chỉ trích vì thương hiệu bán túi giá nghìn USD lại cắt giảm chi phí sản xuất hình ảnh. Equinox rút áp phích chiến dịch ngày 28/07/2026 sau nhiều tuần bị phản ứng.
Khảo sát của DoubleVerify năm 2026 ghi nhận 43% người tiêu dùng Bắc Mỹ nói quảng cáo AI chất lượng thấp làm giảm ấn tượng về thương hiệu. Các khảo sát khác cho con số chênh nhau khá xa, nên đừng dùng một số liệu duy nhất để ra quyết định.
Hướng đi an toàn hơn là dùng AI cho phần nền, phần minh họa và phần thử nghiệm ý tưởng, giữ con người thật ở những khoảnh khắc mang cảm xúc. Một số thương hiệu còn chủ động tự trào về việc dùng AI và nhận phản hồi tích cực hơn hẳn nhóm cố giấu.
Quy trình bốn bước dưới đây phù hợp với đội marketing in-house chưa có kinh nghiệm dựng video AI:
Với doanh nghiệp muốn đưa quy trình này thành hệ thống chạy tự động thay vì làm thủ công từng video, tham khảo giải pháp AI Agent cho từng bộ phận.
Không. OpenAI thông báo ngừng Sora ngày 24/03/2026, đóng app và web ngày 26/04/2026. API sẽ ngừng hoàn toàn ngày 24/09/2026.
Sora là mô hình AI tạo video từ văn bản của OpenAI, ra mắt tháng 12/2024. Bản Sora 2 ra ngày 30/09/2025 bổ sung khả năng sinh âm thanh và hội thoại đồng bộ. Sản phẩm đã ngừng hoạt động.
Veo là dòng mô hình tạo video của Google DeepMind, bản mới nhất là Veo 3.1. Veo sinh video kèm âm thanh đồng bộ và truy cập được qua Gemini app, Google Flow, Gemini API và Vertex AI.
Không có công cụ tốt nhất tuyệt đối. Trên bảng Elo của Artificial Analysis ngày 03/09/2026, nhóm dẫn đầu text-to-video có âm thanh gồm Gemini Omni Flash, Wan 3.0 và MiniMax H3 Max. Các bảng xếp hạng khác cho thứ tự khác nhau.
Tùy công cụ. Veo 3.1 giới hạn 8 giây mỗi lượt và nối tới khoảng 148 giây bằng tính năng extend. Sora khi còn hoạt động công bố tối đa 20 giây ở gói Pro.
Được, theo điều khoản dịch vụ của các nhà cung cấp lớn. Google không tuyên bố sở hữu nội dung người dùng tạo ra. Tuy nhiên quyền theo hợp đồng không đồng nghĩa với việc nội dung hoàn toàn do máy tạo được pháp luật công nhận bản quyền.
Đã có. Nghị định 142/2026/NĐ-CP hiệu lực từ 01/05/2026 yêu cầu gắn nhãn dễ nhận biết cho video AI mô phỏng người thật hoặc tái hiện sự kiện thực tế. Nhãn phải hiển thị trước hoặc tại thời điểm người xem tiếp cận nội dung.
Dùng text-to-video khi chưa có tài sản hình ảnh và cần sáng tạo tự do. Dùng image-to-video khi cần giữ đúng sản phẩm, logo hoặc gương mặt để đảm bảo nhất quán thương hiệu.