AI 模型目录

模型库

Virse 中可用的全部模型,按创作类型分组。点击任意模型查看详情,或直接在画布上开始创作。

视频7 个模型

Google 的原生多模态视频模型,可将文本、图像、视频和音频作为输入,在 Virse 中提供帧驱动和参考驱动两种入口。

Google

Happy Horse 1.0 AI 视频模型只需一张静态图片和一句话,就能基于你已有的画面生成动态效果。

Alibaba

Kuaishou 的 Kling 3.0 会“开口说话”——支持五种语言的唇形同步对白、每个角色使用不同声线,以及可铺排完整镜头序列的故事板模式。

Kuaishou

MiniMax 的 Hailuo 03 模型可生成无声 2K 视频,可由首帧和末帧驱动,也可由一组参考图像驱动。

MiniMax

ByteDance 的 Seedance 2.0 可通过首尾帧或参考图像,一次性生成画面和声音,尺寸范围从 480P 到原生 4K。

ByteDance

使用 Seedance 2.5 生成电影感十足的 30 秒视频,支持同步音频、多模态参考和精准的创意控制。

ByteDance

Google DeepMind 的 Veo 3.1 可生成带有同步 48kHz 音频的短片,并通过延续结尾帧将其扩展为更长的序列。

Google

图像14 个模型

OpenAI 的 ChatGPT Images 2.5 以两个 API 版本 GPT Image 2.5 Flare 和 GPT Image 2.5 Sunburst 登陆 Virse,提供六档质量等级,输出最高可达 4K。

OpenAI

Black Forest Labs 的 FLUX 系列中先于 FLUX 2 的一代,目前以两个条目保留提供——标准模型和 Ultra。

Black Forest Labs

Black Forest Labs 的生产级模型可读取最长 32,000 个 token 的简报,因此品牌规则、颜色值和构图限制都可以一次性输入。

Black Forest Labs

Black Forest Labs 的编辑模型 FLUX Kontext Pro 和 Kontext Max,旨在应用一项描述的更改,同时让画面其余部分保持不变。

Black Forest Labs

OpenAI 的 GPT Image 2.0 能读懂百字创作简报并尝试完成其中的所有要求,同时提供从 1K 到 4K 的独立质量和分辨率控制。

OpenAI

Google 的 Gemini 2.5 Flash Image——原版 Nano Banana——能以对话般的速度生成和编辑图片,因此一次修正只需一句话,而不是一整个会话。

Google

一个围绕布局从零训练的文本到图像基础模型,支持边界框定位、十六进制颜色条件控制,并原生输出 2K 图像。

Ideogram

Google 的 Nano Banana 2 将旗舰级图像质量与 Flash 级速度相结合,提供四种输出尺寸,从快速 0.5K 原型到最终 4K 成品皆可覆盖。

Google

使用 Nano Banana Pro 生成影棚级 4K 图像,融合多个参考,同时保持人物、产品和文字排版的一致性。

Google

阿里巴巴的 Qwen Image 3.0 Pro 将文字作为语言来渲染,覆盖十多种文字系统,即使在密集布局中小至十像素也能保持可读性。

Alibaba

Reve AI 的第二代模型会在渲染前构建一个由定位元素组成的可寻址布局,因此指定的排列会按要求呈现出来。

Reve

ByteDance 的 Seedream 4.0 和 Seedream 4.5 可根据您提供的文字描述和图像进行生成,将一张源图片转化为项目所需的多种方向。

ByteDance

ByteDance 最新一代 Seedream,提供 Seedream 5.0 Pro 和 Seedream V5 Lite 两个版本,二者均采用相同的文字简报。

ByteDance

一个 60 亿参数模型,被压缩为八步推理流程,旨在在你的思路继续推进之前就返回一张可用的图片。

Alibaba