安全与成本提示
API Key 安全
存储安全
| 措施 | 说明 |
|---|---|
| AES 加密存储 | API Key 使用 AES 算法加密后存入数据库 |
| 列表脱敏 | 展示时保留前 4 后 4,中间显示 **** |
| 日志脱敏 | 日志中不打印完整 API Key |
| 传输加密 | 前后端通过 HTTPS 传输 |
访问控制
- 供应商配置仅管理员可操作
- API Key 查看需要二次验证
- 生产环境的 Key 与开发环境隔离
Token 消耗预估
Token 计算规则
| 类型 | 说明 | 估算方法 |
|---|---|---|
| 输入 Token | 发送给模型的内容 | 中文约 1.5 字/Token,英文约 4 字母/Token |
| 输出 Token | 模型返回的内容 | 同上 |
| 知识库检索 | 检索的文档块计入输入 | 分块大小 × Top K |
消耗场景预估
| 场景 | 单次消耗(估算) | 说明 |
|---|---|---|
| 简单问答 | 200-500 Token | 一问一答,无上下文 |
| 多轮对话 | 500-2000 Token | 含历史消息 |
| 知识库问答 | 1500-3000 Token | 含检索的文档块 |
| 文档总结 | 3000-8000 Token | 长文档输入 |
| 图片生成 | 固定计费 | 按张计费,不按 Token |
成本控制策略
限制策略
| 策略 | 配置位置 | 说明 |
|---|---|---|
| 每日调用上限 | Agent 配置 | 限制 Agent 每天最多调用次数 |
| 单次 Token 上限 | 模型配置 | 限制 maxTokens 输出长度 |
| 会话轮次上限 | Agent 配置 | 限制单次会话最大对话轮数 |
| 用户级配额 | 系统配置 | 限制每个用户每日调用次数 |
优化建议
| 优化方向 | 建议 |
|---|---|
| 模型选择 | 简单任务用小模型(如 gpt-4o-mini),复杂任务用大模型 |
| Prompt 精简 | 系统 Prompt 避免冗余,减少输入 Token |
| 上下文管理 | 设置合理的对话历史保留轮数 |
| 缓存策略 | 相同问题直接返回缓存结果 |
| 知识库分块 | 合理设置分块大小,避免召回过多内容 |
监控与告警
监控指标
| 指标 | 说明 |
|---|---|
| 调用次数 | 每日/每周调用统计 |
| Token 消耗 | 输入/输出 Token 分类统计 |
| 费用估算 | 按供应商定价估算费用 |
| 错误率 | 调用失败的比例 |
| 平均延迟 | 响应时间统计 |
告警规则
- 日消耗 Token 超过阈值时告警
- 错误率超过 10% 时告警
- API Key 到期前提醒
