图片和音频接口
CoreRouter 支持 OpenAI 兼容的图片和音频类接口。实际能力、尺寸、音色、文件大小和格式限制取决于模型与渠道,请以控制台说明为准。
接口总览
| 能力 | Endpoint | 请求格式 | 关键字段 |
|---|---|---|---|
| 图片生成 | /v1/images/generations | JSON | model、prompt、size、n |
| 图片编辑 | /v1/images/edits | multipart/form-data 或 JSON | model、image、prompt |
| 旧版图片编辑兼容路径 | /v1/edits | JSON | 旧客户端兼容;需要上传文件时优先用 /v1/images/edits |
| 音频转文字 | /v1/audio/transcriptions | multipart/form-data | model、file |
| 音频翻译 | /v1/audio/translations | multipart/form-data | model、file |
| 文字转语音 | /v1/audio/speech | JSON | model、input、voice |
图片生成
bash
export COREROUTER_API_KEY="sk-xxxxxxxxxxxxxxxx"
curl https://api.corerouter.tech/v1/images/generations \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $COREROUTER_API_KEY" \
-d '{
"model": "image-model-id",
"prompt": "一张干净的科技产品文档封面,深色背景,蓝绿色光效",
"size": "1024x1024",
"n": 1
}'
图片编辑
图片编辑通常使用 multipart/form-data:
bash
curl https://api.corerouter.tech/v1/images/edits \
-H "Authorization: Bearer $COREROUTER_API_KEY" \
-F "model=image-model-id" \
-F "[email protected]" \
-F "prompt=把背景改成深色科技风,保留主体"
/v1/images/edits 也可以按客户端协议使用 JSON,但需要把图片作为该协议支持的 URL 或 Base64 数据传入。不要把同一份 multipart 请求改成 /v1/edits,旧路径不会按新的 multipart 图片编辑流程处理。
音频转文字
bash
curl https://api.corerouter.tech/v1/audio/transcriptions \
-H "Authorization: Bearer $COREROUTER_API_KEY" \
-F "model=audio-model-id" \
-F "[email protected]"
音频翻译
bash
curl https://api.corerouter.tech/v1/audio/translations \
-H "Authorization: Bearer $COREROUTER_API_KEY" \
-F "model=audio-model-id" \
-F "[email protected]"
文字转语音
bash
curl https://api.corerouter.tech/v1/audio/speech \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $COREROUTER_API_KEY" \
-d '{
"model": "tts-model-id",
"voice": "alloy",
"input": "你好,欢迎使用 CoreRouter。"
}' \
--output speech.mp3
使用建议
- 图片张数、尺寸、质量和音频时长都会影响费用,请先小规模测试。
- 图片生成的
n表示生成张数。不要让用户在你的应用里传入无限制的n。 - 图片尺寸使用字母
x,例如1024x1024,不要使用乘号×。 - 对外提供上传入口时,限制文件大小、格式和时长。
- 图片和音频模型 ID 不要复用聊天模型 ID,除非控制台明确说明支持。
- 如果 SDK 对媒体接口封装不完整,可以直接使用 curl 或 HTTP 客户端调用。
- TTS 返回通常是音频字节,curl 需要使用
--output保存文件。 - 语音识别和翻译通常需要上传文件,不能只传文件路径字符串给 JSON。
常见问题
400:检查multipart/form-data字段名是否正确,文件路径是否存在。415:检查文件格式是否受模型支持。- 返回空文件:确认命令里有
--output,并检查响应 Header 是否为音频内容。 - 费用异常:检查
n、尺寸、音频时长和质量参数是否符合预期。
CoreRouter API 文档