Skip to content

图片、ASR 与 TTS

Forge AI 中心支持多模态 AI 能力,包括图片生成、语音识别(ASR)和语音合成(TTS)。

多模态能力概览

能力说明典型供应商
图片生成文本生成图片OpenAI DALL-E、通义万相
图片理解识别和理解图片内容OpenAI GPT-4o、通义千问 VL
语音识别(ASR)语音转文字通义听悟、讯飞
语音合成(TTS)文字转语音OpenAI TTS、通义语音

图片生成配置

  1. 确认供应商支持图片生成能力
  2. 在模型管理中添加图片类型模型(如 dall-e-3
  3. 在 Agent 工具配置中启用图片生成工具
  4. 对话中用户描述需求,AI 调用图片生成接口

图片生成参数

参数说明可选值
图片尺寸生成图片的分辨率1024x1024、1792x1024、1024x1792
图片质量生成质量standard、hd
生成数量一次生成的图片数1-4

图片理解

图片理解允许 AI 分析用户上传的图片:

  1. 用户在对话中上传图片
  2. 系统将图片转为 Base64 编码发送给模型
  3. 模型返回图片描述或分析结果

图片理解需要选择支持视觉能力的模型(如 gpt-4oqwen-vl-max)。

语音识别(ASR)

将语音文件转换为文字:

javascript
// 前端调用 ASR 接口
import { request } from '@/utils/http'

export function speechToText(formData) {
  return request({
    url: '/ai/asr',
    method: 'post',
    data: formData,  // FormData 包含音频文件
    headers: { 'Content-Type': 'multipart/form-data' }
  })
}

支持的音频格式

格式说明
mp3最常用,压缩率高
wav无损,文件较大
m4aApple 设备常用
ogg开源格式

语音合成(TTS)

将文字转换为语音:

参数说明可选值
语音角色说话人音色alloy、echo、fable、onyx
语速播放速度0.5 - 4.0
输出格式音频文件格式mp3、opus、aac、flac

使用建议

  • 图片生成和语音能力消耗的 Token 较多,注意成本控制
  • 上传的图片和音频文件有大小限制(默认 10MB)
  • 多模态能力依赖供应商支持,不同供应商的能力范围不同

下一步

Forge Admin — 基于 Vue3 + Spring Boot 的企业级后台管理框架