文本生成(Text Generation)模型接收文本形式的指令、问题或上下文,并生成自然语言回复。它们适合开放式对话、知识问答、内容生成、摘要、改写、任务拆解等通用语言任务。
代表模型包括:
deepseek-ai/DeepSeek-V4-Pro
Qwen/Qwen3-32B
openai/gpt-oss-120b
完整模型列表和价格,请以 模型广场 为准。
核心能力
文本生成模型通常用于以下能力场景。具体支持范围和效果会因模型而异。
代码生成与数学推理,例如根据自然语言实现函数、重构代码、编写单元测试、分步求解问题,通常也由这类通用模型完成。建议使用较低的 temperature(例如 0.1-0.3),以获得更稳定、更可预期的输出。
使用场景
- 开放式对话:客服机器人、FAQ 助手、对话式智能体。
- 知识问答:企业知识库、文档检索、事实类与流程类解答。
- 内容生成:营销文案、摘要、长篇文章以及创意写作。
- 指令遵循:任务拆解、分步指南以及结构化输出,例如列表、表格。
消息结构
文本生成模型通过消息列表接收输入。常见消息角色如下:
按照 system > user > assistant 历史 的分层方式组织提示词,通常能让输出更稳定;您也可以根据实际场景尝试不同的提示结构。
关键参数
-
控制创造性的参数
temperature:控制输出随机性。取值范围为 0.0-2.0,推荐范围为 0.2-0.8,以在创造性与稳定性之间取得平衡。
top_p:控制采样范围,取值范围为 0.0-1.0,可与 temperature 一起用于调节创造性和稳定性。
-
控制输出的参数
-
max_completion_tokens:限制生成长度,避免输出被截断。
-
stop:设置停止序列。用于控制模型在指定位置停止输出。
-
frequency_penalty:重复惩罚。输出出现重复或乱码时,可尝试调整。
-
stream=True:流式返回 。对于长回复推荐使用,可降低超时风险。
-
上下文
不同模型支持的最大上下文长度可通过 模型广场 查看。
- 如果输出出现乱码,可尝试调整
temperature、top_p 和 frequency_penalty。
- 建议将
max_completion_tokens 控制在最大上下文长度以内,为输入留出空间
- 如果输出被截断,请设置合理的
max_completion_tokens,并启用 stream=True,增大客户端超时时间。
- 公式:总费用 =(输入 tokens × 输入单价)+(输出 tokens × 输出单价)。
- 价格:各模型价格请在 模型广场 的模型详情页查看。
- 建议:
- 在研发阶段优先使用免费或者成本较低的模型。
- 长回复场景建议使用流式输出并合理设置
max_completion_tokens。
- 对于高 QPS 负载,请结合并发控制和限流策略使用。
调用示例
示例使用环境变量读取 API Key,避免将密钥写入代码。
多轮对话
数据分析内容生成
发布说明 / 更新日志