Qwen/Qwen2.5-VL-72B-Instructgoogle/gemma-4-31B-it
核心能力
- 图像理解:描述图像、提取文本(OCR)并回答有关视觉内容的问题。
- 视觉问答:对图表、截图或产品图片进行追问。
- 多模态对话:在一次对话中混合文本和图像,例如“对比这两张图表”。
- 内容审核:使用自然语言指令对图像内容进行分类或标记。
图像消息格式
发送图像时,需要将messages 中的 content 设为数组,数组项类型可以是 text 或 image_url。其中 image_url 既可以是公网可访问的图片 URL,也可以是 data: URL,即 base64 编码的图片。
示例结构:
关键参数
-
参数
-
temperature:控制输出随机性。 -
max_completion_tokens:限制生成长度 ,避免输出被截断。 -
stream=True:流式返回 。对于长回复推荐使用,可降低超时风险。
-
- 上下文 不同模型支持的最大上下文长度可通过 模型广场 查看。
- 图像限制 支持的图像格式和大小限制因模型而异,具体可通过 模型广场 查看。
计费
- 公式:总费用 =(输入 tokens × 输入单价)+(输出 tokens × 输出单价)
- 价格:视觉模型的输入单价(按 token)可能与纯文本模型不同,请在 模型广场 的模型详情页了解视觉输入的具体价格,以及是否存在按图像计费的上限或下限。
-
tokens 计算说明
总输入 tokens = 文本 tokens + 图像 tokens。
- 图像及其他视觉输入在计费时会折算为输入 tokens。不同模型对像素到 token 的映射方式不同:分辨率越高、图片越多,输入 token 通常也越多。
- 同一请求中的文本仍按常规方式计算。
- 如果有多张图像,每张图像都会单独计算 tokens。
-
tokens 计算示例
以代表模型为例,说明视觉内容如何转换为 tokens:
调用示例
示例使用环境变量读取 API Key,避免将密钥写入代码。图像描述
使用 Base64 图像的视觉问答
单次请求中包含多张图像
如果要在一次请求中发送多张图像,只需在同一个content 数组中继续添加 image_url 条目。模型会同时接收这些图像,并据此完成对比、归纳等任务。
