Skip to content
On this page

图片和音频接口

CoreRouter 支持 OpenAI 兼容的图片和音频类接口。实际能力、尺寸、音色、文件大小和格式限制取决于模型与渠道,请以控制台说明为准。

接口总览

能力Endpoint请求格式关键字段
图片生成/v1/images/generationsJSONmodel、prompt、size、n
图片编辑/v1/images/editsmultipart/form-data 或 JSONmodel、image、prompt
旧版图片编辑兼容路径/v1/editsJSON旧客户端兼容;需要上传文件时优先用 /v1/images/edits
音频转文字/v1/audio/transcriptionsmultipart/form-datamodel、file
音频翻译/v1/audio/translationsmultipart/form-datamodel、file
文字转语音/v1/audio/speechJSONmodel、input、voice

图片生成

bash
export COREROUTER_API_KEY="sk-xxxxxxxxxxxxxxxx"

curl https://api.corerouter.tech/v1/images/generations \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $COREROUTER_API_KEY" \
  -d '{
    "model": "image-model-id",
    "prompt": "一张干净的科技产品文档封面,深色背景,蓝绿色光效",
    "size": "1024x1024",
    "n": 1
  }'

图片编辑

图片编辑通常使用 multipart/form-data:

bash
curl https://api.corerouter.tech/v1/images/edits \
  -H "Authorization: Bearer $COREROUTER_API_KEY" \
  -F "model=image-model-id" \
  -F "[email protected]" \
  -F "prompt=把背景改成深色科技风,保留主体"

/v1/images/edits 也可以按客户端协议使用 JSON,但需要把图片作为该协议支持的 URL 或 Base64 数据传入。不要把同一份 multipart 请求改成 /v1/edits,旧路径不会按新的 multipart 图片编辑流程处理。

音频转文字

bash
curl https://api.corerouter.tech/v1/audio/transcriptions \
  -H "Authorization: Bearer $COREROUTER_API_KEY" \
  -F "model=audio-model-id" \
  -F "[email protected]"

音频翻译

bash
curl https://api.corerouter.tech/v1/audio/translations \
  -H "Authorization: Bearer $COREROUTER_API_KEY" \
  -F "model=audio-model-id" \
  -F "[email protected]"

文字转语音

bash
curl https://api.corerouter.tech/v1/audio/speech \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $COREROUTER_API_KEY" \
  -d '{
    "model": "tts-model-id",
    "voice": "alloy",
    "input": "你好,欢迎使用 CoreRouter。"
  }' \
  --output speech.mp3

使用建议

  • 图片张数、尺寸、质量和音频时长都会影响费用,请先小规模测试。
  • 图片生成的 n 表示生成张数。不要让用户在你的应用里传入无限制的 n。
  • 图片尺寸使用字母 x,例如 1024x1024,不要使用乘号 ×。
  • 对外提供上传入口时,限制文件大小、格式和时长。
  • 图片和音频模型 ID 不要复用聊天模型 ID,除非控制台明确说明支持。
  • 如果 SDK 对媒体接口封装不完整,可以直接使用 curl 或 HTTP 客户端调用。
  • TTS 返回通常是音频字节,curl 需要使用 --output 保存文件。
  • 语音识别和翻译通常需要上传文件,不能只传文件路径字符串给 JSON。

常见问题

  • 400:检查 multipart/form-data 字段名是否正确,文件路径是否存在。
  • 415:检查文件格式是否受模型支持。
  • 返回空文件:确认命令里有 --output,并检查响应 Header 是否为音频内容。
  • 费用异常:检查 n、尺寸、音频时长和质量参数是否符合预期。

Released under the MIT License.