OpenAI 接口格式 生图
图像接口用于根据文本描述成图像,部分模型支持参考图。通过 model 参数区分模型,content 数组可含 text 和 image,实现文生图和图生图。
| 项目 | 说明 |
|---|---|
| 请求方法 | POST |
| 接口地址 | https://api.taiha.cn/v1/images/generations |
| 鉴权 | 请求头 Authorization: Bearer |
| Model ID | 在模型广场对应模型详情中查看 |
千问 / 万相图像模型
适用于千问图像、万相文生图等模型(如
qwen-image-*、wan*等)。请求体为input+parameters结构:用户意图放在input.messages[].content(文本用text,参考图用image),生成选项放在parameters(如size、n、水印等)。
接口能力
常见能力(以具体 Model ID 为准)
- 文生图;部分型号支持参考图、多图、提示词扩展等
- 不同 Model ID 对同步 / 异步、流式的支持不同,以所选模型文档为准
参数与取值范围(size 写法、n、负向提示词、组图等)请查阅对应模型的官方 API 说明。
关键能力
1. 指令遵循(提示词)
参数:messages.content.text或input.prompt(必选)、negative_prompt(可选)。
- text \ prompt(正向提示词):描述希望在画面中看到的内容、主体、场景、风格、光照和构图。文生图的核心控制参数。
- negative_prompt(反向提示词):描述不希望在画面中出现的内容,如“模糊”、“多余的手指”等。仅用于辅助优化生成质量。 撰写技巧:一个结构化的 Prompt 通常能带来更好的效果,撰写技巧请参见文生图Prompt指南。
wan2.7-image-pro、wan2.7-image不支持negative_prompt参数,对于不希望出现的元素,请在正向提示词中描述(不要出现xxx)。
2. 开启prompt智能改写
参数: parameters.prompt_extend (bool, 默认为 true)。
此功能可自动扩展和优化较短的Prompt,提升出图效果。开启此功能额外耗时 3-5 秒。此耗时为使用大模型改写文本。
实践建议:
- 建议开启:当输入 Prompt 较简洁或宽泛时,此功能可显著提升图像效果。
- 建议关闭:若需控制画面细节、或已提供详细描述,或对响应延迟敏感。请将参数
prompt_extend**显式设为 **false。
wan2.7-image-pro、wan2.7-image不支持
prompt_extend参数,可通过开启thinking_mode提升出图质量。
3. 设置输出图像分辨率
参数: parameters.size (string),格式为 "宽*高"。
| 模型 | size格式 | 总像素支持范围 | 默认 | 宽高比 |
|---|---|---|---|---|
| wan2.7-image-pro | 缩写 | 1K(1024*1024)、2K(2048*2048)、4K(4096*4096) | 2K(2048*2048) | 1:8 – 8:1 |
自定义"宽*高" | 768*768 – 4096*4096 | |||
| wan2.7-image | 缩写 | 1K(1024*1024)、2K(2048*2048) | 2K(2048*2048) | 1:8 – 8:1 |
自定义"宽*高" | 768*768 – 2048*2048 | |||
| wan2.6-image(图文混排输出模式) | 自定义"宽*高" | 768*768 – 1280*1280 | 匹配输入宽高比 (≤1280*1280) | 1:4 – 4:1 |
| wan2.6-t2i, wan2.5-t2i-preview | 自定义"宽*高" | 1280*1280 – 1440*1440 | 1280*1280 | 1:4 – 4:1 |
| wan2.2 及更早的 t2i 模型 | 自定义"宽*高" | [512, 1440],且总像素 ≤1440*1440 | 1024*1024 | - |
| qwen-image-2.0 系列 | 自定义"宽*高" | 512*512 – 2048*2048 | 2048*2048 | - |
| qwen-image-max / qwen-image-plus 系列 | 仅限固定预设尺寸 | 见下方预设尺寸 | 1664*928 (16:9) | - |
4. 组图生成
参数:parameters.enable_sequential(bool,默认为 false)。仅wan2.7-image-pro和wan2.7-image支持。
设为true时启用组图模式,模型将根据提示词和参考图片的内容一次性生成多张有故事连贯性的图像。
- 生成数量:通过
n参数控制,开启组图模式时,取值范围1~12(默认12),实际数量由模型决定且不超过n。 - 注意:开启组图模式时,
thinking_mode和color_palette参数不可用。
5. 思考模式
参数:parameters.thinking_mode(bool,默认为 true)。仅wan2.7-image-pro和wan2.7-image支持。
开启时,模型将增强推理能力以提升出图质量,但会增加生成耗时。
仅在关闭组图模式(
enable_sequential=false)时可用。
6. 自定义颜色主题
参数:parameters.color_palette(array)。仅wan2.7-image-pro和wan2.7-image支持。
通过传入包含颜色(hex)和占比(ratio)的对象数组,自定义生成图像的颜色方案。需包含3至10种颜色,推荐设置为8种。所有ratio值相加总和必须为100.00%。
仅在关闭组图模式(
enable_sequential=false)时可用。
请求示例
POST /v1/images/generations
- cURL
curl -X POST 'https://api.taiha.cn/v1/images/generations' \
-H 'Authorization: Bearer <API Key>' \
-H 'Content-Type: application/json' \
-d '{
"model": "<Model ID>",
"input": {
"messages": [{
"role": "user",
"content": [{
"image": "https://help-static-aliyun-doc.aliyuncs.com/file-manage-files/zh-CN/20260310/jiydyi/image+%2818%29-2026-03-10-16-39-59.webp"
}, {
"text": "在画面右下角石板路旁、靠近树干根部的位置,以浅灰墨色手写体题写一首七言绝句,字体为行楷风格,笔触自然流畅、略带飞白,大小适中(约占画面高度1/10),与整体水墨淡雅氛围协调。诗文内容为:"青石桥畔柳风轻, 素手拈花闭目听。 一水碧痕浮旧梦, 半篙烟雨入空舲。"诗句横向排列,四句分两行书写(前两句一行,后两句一行),末句"舲"字右下角钤一枚朱红小印,印文为"江南"二字篆书,尺寸约等于单字高度的1/3。"
}]
}]
},
"parameters": {
"negative_prompt" : "低分辨率,低画质,肢体畸形,手指畸形,画面过饱和,蜡像感,人脸无细节,过度光滑,画面具有AI感。构图混乱。文字模糊,扭曲。",
"prompt_extend" : true,
"n": 1,
"watermark": false,
"size": "2048x2048"
}
}'
带参考图时,在 content 中增加
{ "image": "https://example.com/ref.png" }(与官方文档一致)。size 等字段的格式(如 1024*1024 与 2K)请按所选 Model ID 的说明填写。图片支持传入公网可访问URL,同时支持base64文本传入。
说明: Qwen 和 Wan 模型共用同一套
/v1/images/generations接口,通过model参数区分模型。content数组中可以包含text(文本提示词)和image(参考图 URL)两种类型,实现文生图和图生图。
豆包 Seedream 文生图模型
适用于
doubao-seedream-*等Seedream系列(如doubao-seedream-4.5、doubao-seedream-3.0-t2i)。请求体为顶层扁平 JSON:prompt、size、image(参考图)等字段写在同一层。
常见能力(以具体 Model ID 为准)
- 文生图;部分型号支持参考图、组图、
stream流式返回 - 提示词写在
prompt;参考图写在image(URL 或 base64)
参数与取值范围(分辨率档位、组图、guidance_scale、seed 等)请查阅该系列模型的官方 API 说明。
请求示例
POST /v1/images/generations
- cURL
curl -X POST 'https://api.taiha.cn/v1/images/generations' \
-H 'Authorization: Bearer <API Key>' \
-H 'Content-Type: application/json' \
-d '{
"model": "<Model ID>",
"prompt": "星际穿越,黑洞,黑洞里冲出一辆快支离破碎的复古列车,抢视觉冲击力,电影大片,末日既视感,动感,对比色,oc渲染,光线追踪,动态模糊,景深,超现实主义,深蓝,画面通过细腻的丰富的色彩层次塑造主体与场景,质感真实,暗黑风背景的光影效果营造出氛围,整体兼具艺术幻想感,夸张的广角透视效果,耀光,反射,极致的光影,强引力,吞噬",
"image": [
"https://ark-project.tos-cn-beijing.volces.com/doc_image/seedream4_imagesToimage_1.png",
"https://ark-project.tos-cn-beijing.volces.com/doc_image/seedream4_imagesToimage_2.png"
],
"response_format": "url",
"size": "2K",
"stream": false,
"watermark": false
}'
常见问题
Q:图片 URL 多久会失效?我应该如何永久保存图片?
- 图片 URL 的有效期为 24 小时。您必须在获取到 URL 后,立即通过程序下载图片,并将其保存到您自己的持久化存储中,例如本地服务器或阿里云对象存储 OSS。
- 如果
千问 / 万相系列模型返回的资源地址中的&参数拼接符被转换为unicode编码时,需要单独处理转回才可正常访问获取。 其中的
\u0026需要转换为&再进行下载
Q:调用API返回DataInspectionFailed错误,如何处理?
该错误表示输入文本触发了内容安全审核。请检查并修改prompt或negative_prompt中的文本,移除可能违规的内容后重试。
Q:prompt_extend参数应该开启还是关闭?
当输入的prompt比较简洁或希望模型发挥更多创意时,建议保持开启(默认)。当prompt已经非常详细、专业,或对API响应延迟有严格要求时,建议显式设置为false。
注意:wan2.7-image-pro、wan2.7-image不支持prompt_extend参数,可通过开启thinking_mode提升出图质量。