版本可追溯的全球AI模型资料库

多模态理解 AI模型

能够理解文本、图片、音频或视频等多种输入的AI模型。

47 个已核对模型12 家厂商 官方来源 版本状态
选模型先问四件事
  1. 任务需要多强的推理?
  2. 输入输出是否包含图片、音频或视频?
  3. 走API、云产品还是本地部署?
  4. 旧版本是否已经预告弃用?
MODEL INDEX

多模态理解模型

共 8 条
字
当前可用完整度 100/100

Doubao Seed 2.0 Pro

Doubao Seed 2.0 Pro模型资料:精确版本、开放状态、输入输出、上下文、适用任务、限制和官方来源。

厂商
字节跳动 / 火山引擎
输入
文本、图像、多模态
获取
火山方舟 API、豆包专家模式
发布
2026
适合:复杂深度推理、Agent 与高难度多模态任务
字
当前可用完整度 100/100

Doubao Seed 2.0 Lite

Doubao Seed 2.0 Lite模型资料:精确版本、开放状态、输入输出、上下文、适用任务、限制和官方来源。

厂商
字节跳动 / 火山引擎
输入
文本、图像、多模态
获取
火山方舟 API、豆包
发布
2026
适合:通用生产任务、多模态理解与成本均衡应用
字
当前可用完整度 100/100

Doubao Seed 2.0 Mini

Doubao Seed 2.0 Mini模型资料:精确版本、开放状态、输入输出、上下文、适用任务、限制和官方来源。

厂商
字节跳动 / 火山引擎
输入
文本、图像、多模态
获取
火山方舟 API
发布
2026
适合:低成本高并发、分类提取和轻量多模态任务
百
当前可用完整度 100/100

ERNIE 5.0

ERNIE 5.0模型资料:精确版本、开放状态、输入输出、上下文、适用任务、限制和官方来源。

厂商
百度
输入
文本、图像、多模态
获取
百度智能云千帆 API
发布
2025
适合:中文多模态理解、深度推理、工具使用和企业 Agent
G
当前可用完整度 100/100

Gemini 3.5 Flash

Gemini 3.5 Flash模型资料:版本状态、能力、获取方式、适用场景、限制与官方来源。

厂商
Google
输入
文本、图像、音频、视频
获取
Gemini、Google AI Studio、API
发布
2026-05-20
适合:多模态理解、快速智能体、规模化应用
M
当前可用完整度 100/100

Muse Spark

Muse Spark模型资料:版本状态、能力、获取方式、适用场景、限制与官方来源。

厂商
Meta
输入
文本、图像
获取
meta.ai/app
发布
2026-04-08
适合:多模态推理、工具调用、多智能体任务
G
预览/测试完整度 100/100

Gemini Omni

Gemini Omni模型资料:版本状态、能力、获取方式、适用场景、限制与官方来源。

厂商
Google
输入
文本、图像、音频、视频
获取
预览/逐步开放
发布
2026-05
适合:原生多模态交互、实时助手
M
当前可用完整度 100/100

Mistral Large 3

Mistral Large 3模型资料:版本状态、能力、获取方式、适用场景、限制与官方来源。

厂商
Mistral AI
输入
文本、图像
获取
开放权重、API
发布
2025-12
适合:通用多模态、企业应用、私有部署评估