图片、ASR 与 TTS
Forge AI 中心支持多模态 AI 能力,包括图片生成、语音识别(ASR)和语音合成(TTS)。
多模态能力概览
| 能力 | 说明 | 典型供应商 |
|---|---|---|
| 图片生成 | 文本生成图片 | OpenAI DALL-E、通义万相 |
| 图片理解 | 识别和理解图片内容 | OpenAI GPT-4o、通义千问 VL |
| 语音识别(ASR) | 语音转文字 | 通义听悟、讯飞 |
| 语音合成(TTS) | 文字转语音 | OpenAI TTS、通义语音 |
图片生成配置
- 确认供应商支持图片生成能力
- 在模型管理中添加图片类型模型(如
dall-e-3) - 在 Agent 工具配置中启用图片生成工具
- 对话中用户描述需求,AI 调用图片生成接口
图片生成参数
| 参数 | 说明 | 可选值 |
|---|---|---|
| 图片尺寸 | 生成图片的分辨率 | 1024x1024、1792x1024、1024x1792 |
| 图片质量 | 生成质量 | standard、hd |
| 生成数量 | 一次生成的图片数 | 1-4 |
图片理解
图片理解允许 AI 分析用户上传的图片:
- 用户在对话中上传图片
- 系统将图片转为 Base64 编码发送给模型
- 模型返回图片描述或分析结果
图片理解需要选择支持视觉能力的模型(如
gpt-4o、qwen-vl-max)。
语音识别(ASR)
将语音文件转换为文字:
javascript
// 前端调用 ASR 接口
import { request } from '@/utils/http'
export function speechToText(formData) {
return request({
url: '/ai/asr',
method: 'post',
data: formData, // FormData 包含音频文件
headers: { 'Content-Type': 'multipart/form-data' }
})
}支持的音频格式
| 格式 | 说明 |
|---|---|
| mp3 | 最常用,压缩率高 |
| wav | 无损,文件较大 |
| m4a | Apple 设备常用 |
| ogg | 开源格式 |
语音合成(TTS)
将文字转换为语音:
| 参数 | 说明 | 可选值 |
|---|---|---|
| 语音角色 | 说话人音色 | alloy、echo、fable、onyx |
| 语速 | 播放速度 | 0.5 - 4.0 |
| 输出格式 | 音频文件格式 | mp3、opus、aac、flac |
使用建议
- 图片生成和语音能力消耗的 Token 较多,注意成本控制
- 上传的图片和音频文件有大小限制(默认 10MB)
- 多模态能力依赖供应商支持,不同供应商的能力范围不同
