Skip to main content
多模态功能使 Agent 能够理解和生成图像、音频、视频等多种媒体内容。

核心特性

  • 架构统一:ContentBlock 体系统一处理文本、图像、音频、视频
  • 灵活来源:支持 Base64 编码和 URL 两种媒体加载方式
  • 混合消息:单条消息可包含多种媒体类型和文本
  • 模型适配:自动转换为不同模型 API 的格式要求

核心概念

ContentBlock 架构

AgentScope 使用统一的 ContentBlock 体系处理所有类型的内容:

媒体来源

支持两种媒体来源方式:
  • Base64 编码:将媒体文件编码为字符串(推荐,兼容性好)
  • URL 引用:通过 HTTP/HTTPS URL 或本地文件路径引用

快速开始

步骤 1:创建媒体内容块

支持的 MIME 类型
  • 图像:image/pngimage/jpegimage/gifimage/webp
  • 音频:audio/mp3audio/wavaudio/mpeg
  • 视频:video/mp4video/mpeg

步骤 2:构建多模态消息

步骤 3:配置 Vision Agent

关键配置
  • DashScope 视觉模型必须使用 DashScopeChatFormatter
  • 推荐使用 Base64 编码图像以获得最佳兼容性

完整示例


支持的模型

DashScope(阿里云)

OpenAI

Anthropic


更多资源