Skip to main content
文本生成(Text Generation)模型接收文本形式的指令、问题或上下文,并生成自然语言回复。它们适合开放式对话、知识问答、内容生成、摘要、改写、任务拆解等通用语言任务。 代表模型包括:
  • deepseek-ai/DeepSeek-V4-Pro
  • Qwen/Qwen3-32B
  • openai/gpt-oss-120b
完整模型列表和价格,请以 模型广场 为准。

核心能力

文本生成模型通常用于以下能力场景。具体支持范围和效果会因模型而异。
代码生成与数学推理,例如根据自然语言实现函数、重构代码、编写单元测试、分步求解问题,通常也由这类通用模型完成。建议使用较低的 temperature(例如 0.1-0.3),以获得更稳定、更可预期的输出。

使用场景

  • 开放式对话:客服机器人、FAQ 助手、对话式智能体。
  • 知识问答:企业知识库、文档检索、事实类与流程类解答。
  • 内容生成:营销文案、摘要、长篇文章以及创意写作。
  • 指令遵循:任务拆解、分步指南以及结构化输出,例如列表、表格。

消息结构

文本生成模型通过消息列表接收输入。常见消息角色如下:
按照 system > user > assistant 历史 的分层方式组织提示词,通常能让输出更稳定;您也可以根据实际场景尝试不同的提示结构。

关键参数

说明

  • 控制创造性的参数
    • temperature:控制输出随机性。取值范围为 0.0-2.0,推荐范围为 0.2-0.8,以在创造性与稳定性之间取得平衡。
    • top_p:控制采样范围,取值范围为 0.0-1.0,可与 temperature 一起用于调节创造性和稳定性。
  • 控制输出的参数
    • max_completion_tokens:限制生成长度,避免输出被截断。
    • stop:设置停止序列。用于控制模型在指定位置停止输出。
    • frequency_penalty:重复惩罚。输出出现重复或乱码时,可尝试调整。
    • stream=True:流式返回 。对于长回复推荐使用,可降低超时风险。
  • 上下文 不同模型支持的最大上下文长度可通过 模型广场 查看。

建议

  • 如果输出出现乱码,可尝试调整 temperaturetop_pfrequency_penalty
  • 建议将 max_completion_tokens 控制在最大上下文长度以内,为输入留出空间
  • 如果输出被截断,请设置合理的 max_completion_tokens,并启用 stream=True,增大客户端超时时间。

计费

  • 公式:总费用 =(输入 tokens × 输入单价)+(输出 tokens × 输出单价)。
  • 价格:各模型价格请在 模型广场 的模型详情页查看。
  • 建议
    • 在研发阶段优先使用免费或者成本较低的模型。
    • 长回复场景建议使用流式输出并合理设置 max_completion_tokens
    • 对于高 QPS 负载,请结合并发控制和限流策略使用。

调用示例

示例使用环境变量读取 API Key,避免将密钥写入代码。

多轮对话

数据分析内容生成

发布说明 / 更新日志