OpenAI API 代理:网关、路由与直接无审查模型对比
更新于
OpenAI API 代理将请求路由到底层模型,通常会为多供应商访问引入延迟和复杂性。对于需要单一高性能无审查模型且无需模型路由开销的开发者,直接无审查 LLM API 提供了更简单、更可预测的替代方案。
要点
- 代理聚合多个模型,但会增加延迟和路由复杂性。
- 直接无审查 API 提供单模型性能,价格透明且固定。
- 我们的 API 提供严格的 100k 上下文窗口和函数调用,且无需模型切换开销。
- 对于一致的行为和更低的延迟,专用接口通常优于路由网关。
什么是 OpenAI API 代理?
OpenAI API 代理充当你的客户端应用与一个或多个底层大语言模型 (LLM) 提供商之间的中介。代理接收你的请求,可能修改头部或负载,然后将其转发到目标服务。这种架构允许通过单个集成点访问来自不同供应商的多个模型,例如在不更改客户端代码的情况下在 GPT-4、Claude 和 Gemini 之间切换。
代理特别适用于抽象层。它们可以处理跨不同供应商的重试、速率限制和回退逻辑。然而,这种抽象是有代价的。每个代理层都会增加网络跳数,从而增加延迟。此外,代理通常在基础模型成本之上收取自己的定价层级,可能导致总成本高于直接访问。对于需要一致行为配置文件且无需多模型变体的开发者,代理可能会增加不必要的复杂性。
网关与直接模型托管
LLM 网关和路由器是代理的高级形式,它们根据成本、延迟或能力智能地将请求路由到最佳模型。虽然对于需要多样化模型优势的大规模应用非常强大,但它们引入了显著的运营开销。你必须管理路由规则,监控多个供应商 API,并处理不同供应商之间不同的速率限制。
相比之下,直接模型托管将你的应用程序连接到单一的专用接口。这种方法消除了路由逻辑并减少了网络请求的数量。对于许多用例,特别是那些需要一致模型行为的用例,直接托管更可靠。我们的服务提供单一的高性能无审查模型。你只需更改基础 URL 和 API 密钥,现有代码即可立即工作。这种“即插即用”兼容性意味着你可以保留 OpenAI SDK 生态系统的优势,而无需管理多个供应商集成的复杂性。
定价模式:聚合与固定费率
聚合网关通常按请求收取溢价或在基础模型 token 成本之上收取月订阅费。这种模式可能不可预测,因为费用因模型和地区而异。一些网关还施加最低月承诺或分层定价,随着使用量增加,成本可能会变得昂贵。
直接 API 通常提供透明的按 token 定价,无隐藏费用。我们的 API 采用简单的按量付费模式:每 1M 输入 token $0.25,每 1M 输出 token $1.00。无订阅、无月费,预付额度永不过期。你可以以低至 $10 的金额充值,大额购买可获得额外额度。这种简洁性允许你根据 token 使用情况精确计算成本,避免聚合服务中常见的不透明附加费。
延迟与吞吐量考量
延迟是 LLM 应用中的关键因素。每个额外的代理层都会增加网络往返时间。跨多个供应商或地区路由请求的网关可能会引入响应时间的变异性。如果网关将请求路由到较慢的模型或拥塞的提供商,你的应用程序会经历更高的延迟。
直接托管最小化了这些变量。通过连接到单一接口,你减少了跳数并获得一致的吞吐量。我们的无审查模型在专用 GPU 服务器上运行,确保可预测的性能。凭借严格的 100k 上下文窗口,你可以处理长文档而无需过度截断 token。API 支持通过服务器发送事件 (SSE) 进行流式输出,允许你在生成 token 时显示它们,从而改善最终用户的感知延迟。对于需要低延迟响应的应用,直接接口通常优于多供应商网关。
功能对等:函数调用与流式输出
现代 LLM API 必须支持函数调用和流式输出才能用于生产应用。代理必须跨不同的底层模型正确翻译这些功能,如果网关不完全支持最新的 SDK 功能,有时会导致兼容性问题。
我们的 API 完全支持通过 SSE 进行工具/函数调用和流式输出,确保与官方 OpenAI SDK 和任何兼容 OpenAI 的客户端兼容。接口为 POST /v1/chat/completions,你可以通过 GET /v1/models 获取模型详情。没有嵌入、图像、音频或视频生成接口,使 API 专注于文本补全。这种简洁性减少了攻击面和潜在的故障点。对于需要强大的函数调用且无需管理多个模型特定怪癖的开发者,直接无审查 API 提供了稳定的基础。
隐私与数据使用政策
使用代理时,你的数据会经过额外的服务器。根据提供商的政策,你的提示词可能会被记录、缓存,甚至用于训练。一些网关保留更长时间的数据以改进其路由算法或服务质量。
我们的 API 强调隐私。账户只需邮箱和密码;试用无需手机号或信用卡。提示词不用于训练,确保你的数据保持私密。该服务专为重视数据主权的开发者设计。此外,我们执行严格的内容限制:涉及未成年人的性内容会被阻止,但合法的成人、虚构和争议性主题不会被拒绝。这种平衡允许创意和技术用例,而不会出现过度审查,这是某些应用 blanket 过滤器的代理服务中常见的问题。
何时选择专用无审查模型
当你需要一致的行为而无需多供应商的变体时,专用无审查模型是理想选择。如果你的应用依赖于特定的模型特征,例如特定的推理风格或缺乏拒绝,代理可能会根据路由规则切换模型,从而引入不一致性。
我们的无审查模型是一个开放权重模型,经过调整以在法律成人用途下无内容拒绝地回答问题。它不是 GPT、Claude、Gemini 或任何其他供应商的模型。这种区别对于希望避免专有模型“黑盒”性质的开发者至关重要。凭借 100k 上下文窗口,你可以处理大输入而不会丢失上下文。API 支持流式输出和函数调用,使其适合复杂应用。如果你需要用于无审查文本生成的单一可靠接口,专用 API 通常比多模型网关更高效。
决策表:代理与直接 API
| 功能 | 代理/网关 | 直接无审查 API |
|---|---|---|
| 模型多样性 | 高(多供应商) | 单模型 |
| 延迟 | 较高(多次跳转) | 较低(直接连接) |
| 定价 | 复杂(基础 + 高级) | 透明(按 token) |
| 配置 | 路由规则 | 简单(基础 URL + 密钥) |
| 隐私 | 视情况而定(数据记录) | 高(无需训练) |
该表格突出了权衡关系。代理提供多样性,但以增加延迟和复杂性为代价。直接 API 提供速度和简洁性。对于优先考虑性能和透明度的开发者而言,直接无审查 API 通常是更好的选择。
问答
该服务是官方 OpenAI 产品吗?
不是,这是一个独立服务。我们提供兼容 OpenAI 的接口,使用我们自己的无审查模型,而非 GPT-4 或 GPT-3.5。它与 OpenAI SDK 兼容,但与 OpenAI 无隶属关系。
API 支持嵌入或图像生成吗?
不支持,API 专注于文本补全。它支持带流式输出和函数调用的 POST /v1/chat/completions,但不提供嵌入、图像、音频或视频生成接口。
价格如何计算?
定价为每 1M 输入 token 0.25 美元,每 1M 输出 token 1.00 美元。无月费或订阅费。预付额度永不过期。
我的数据会用于训练吗?
不是,提示词不用于训练。你只需邮箱和密码即可创建账户,试用无需手机号或信用卡。
只差一张表单,即可获得密钥
创建账户,复制密钥,更改基础 URL。这就是全部设置。