Veo 3.1 是 Google DeepMind 的 AI 视频模型:原生 4K、音频与画面在同一次生成中一起产出,电影级提示理解全场领先。它能做什么,以及什么时候值得为它的溢价买单。
5 minAI 视频与图像模型详解
每个主流生成模型能做什么、怎么写提示词、什么时候用——Seedance、Veo、Kling、MiniMax 海螺、Runway、Seedream、Nano Banana 等。
视频模型
Kling 3.0 是 AI 视频的性价比之王,约 $0.10/秒,专为多镜头电影级序列打造,能让同一角色跨镜头保持一致。它能做什么、怎么写提示词、什么时候该选它。
5 minLuma Dream Machine 由 Ray 3 驱动,是主打流畅运镜和关键帧执导的 AI 视频模型。Ray 3 与 Ray3.14 能做什么、怎么写提示词、什么时候该用它。
5 minMiniMax H3(海螺 3.0)能生成带原生立体声音频的 2K 视频,并以开源权重发布。它能做什么、怎么写提示词,以及何时该选它而非 Seedance 或 Kling。
5 minRunway Gen-4.5 把顶级视频质量与真正的编辑工具链结合——Motion Brush、Act-Two、Aleph、导演模式。它能做什么、怎么用,以及什么时候该用它而非纯文生视频模型。
5 minSeedance 2.5 是字节跳动的 AI 视频模型,能一次性生成原生 30 秒 4K 镜头,支持最多 50 个参考输入。它能做什么、怎么写提示词、什么时候该用它。
4 minSora 2 凭原生同步音频树立了电影级 AI 视频的标杆。但 OpenAI 要关停它:App 已于 2026 年 4 月 26 日关闭,API 将在 2026 年 9 月 24 日停服。它做了什么,以及现在如何迁移。
4 minWan 2.2 是阿里巴巴基于 Apache 2.0 协议开源的视频模型——文生视频、图生视频,还有能在 24GB 显卡上跑的 5B 版本。它能做什么、怎么部署,以及什么时候开源权重胜过托管平台。
5 min图像模型
FLUX.2 是 Black Forest Labs 的开源权重图像模型家族——单个 32B 检查点同时负责生成与编辑,提示词遵循度强、文字排版清晰,且可自托管。它能做什么、怎么用。
4 minGPT Image 是 OpenAI 的图像模型家族,当家旗舰 GPT Image 2 会先规划版式、再渲染清晰可读的文字。它能做什么、怎么写提示词、什么时候该用它。
5 minIdeogram 3.0 是专为画面内清晰文字打造的图像模型——Logo、海报、包装、招牌。它能做什么、怎么写提示词,以及相对 Midjourney、Flux 的定位。
5 minMidjourney v7 让「可复用的统一画风」第一次变得现实:更稳定的 --sref、Omni 参考、个性化 v2 与 Draft 模式。它能做什么,以及什么时候仍该选它。
5 minNano Banana 是谷歌 Gemini 的图像生成与编辑模型,以「编辑后人还是同一个人」著称。它能做什么、家族怎么划分、以及如何写提示词。
5 minSeedream 5.0 是字节跳动的照片级 AI 图像与编辑模型——重打光、换背景/台面、而产品本身保持真实。它能做什么、怎么用它做编辑、定位如何。
5 min