🤔 Introducing APISIX AI Gateway – Built for LLMs and AI workloads. Learn More

Apache APISIX AI Gateway

面向 LLM 与 AI Agent 的开源 AI 网关

使用 Apache APISIX 构建开源 AI 与 LLM 网关,提供多提供商代理、负载均衡、重试、token 限制、提示词控制、RAG 和网关层可观测能力。

Apache 2.0
开源许可证
100+
网关插件
API + AI
统一承载两类流量

一个网关,两类流量

统一管理 API 与 AI 流量

在接入 LLM 流量的同时,继续使用团队熟悉的路由、安全、可观测和运维体系。

Apache APISIX

开源部署控制

在自主管理的基础设施中运行 Apache 2.0 许可的网关,并通过开放插件模型进行扩展。

100+

网关能力

覆盖认证、流量控制、可观测、Serverless 和 AI 的插件。

开放的 AI 插件生态

按需组合已有文档的 AI 插件,实现提供商接入、路由、token 控制、检索增强、提示词处理、内容审核和网关日志。

AI 插件图标

AI 网关解析

什么是 AI 网关?

AI 网关是位于应用与模型提供商之间的流量控制层,让团队可以集中为模型请求配置提供商接入、路由、用量限制、提示词处理和遥测能力。

Apache APISIX 对经过网关的 AI 与 LLM 流量应用已配置的策略。应用授权、工具选择、工作流状态、Agent 编排和模型质量评估仍由外围应用技术栈负责。

需求 APISIX 插件 配置内容
连接模型提供商 ai-proxy 代理请求到文档列出的提供商及 OpenAI 兼容端点。
在模型实例间路由 ai-proxy-multi 配置负载均衡或语义路由;重试和健康检查行为取决于所选算法。
控制 token 消耗 ai-rate-limiting 记录提供商返回的 token 用量,并在配置额度耗尽后拒绝后续请求。
增加检索上下文 ai-rag 使用文档支持的 Azure OpenAI 与 Azure AI Search RAG 流程。
检查提示词规则 ai-prompt-guard 使用已配置的正则表达式规则允许或拒绝请求。
缓存完整响应 ai-cache 与 ai-proxy 或 ai-proxy-multi 配合,实现 Redis 支持的精确缓存和可选语义缓存。
检查受支持的 AI 流量 ai-lakera-guard 与 ai-proxy 或 ai-proxy-multi 配合,通过 Lakera Guard v2 API 检查受支持的流量。

架构

连接应用与模型的统一控制点

Apache APISIX AI 网关架构

为生产级 AI 流量而生

在网关层获得可靠性、控制力与可见性

多 LLM 负载均衡

使用加权轮询或一致性哈希,或根据提示词与各实例示例的相似度配置语义路由。

查看插件文档

Token 限流

使用本地或 Redis 计数器记录提供商返回的 token 用量,并在配置额度耗尽后拒绝后续请求。

查看插件文档

AI RAG

通过插件当前支持的 Azure OpenAI 与 Azure AI Search 集成,为请求补充检索到的上下文。

查看插件文档

Token 可观测性

启用 AI 代理日志后,记录模型、延迟、token 用量和首 token 响应时间等摘要。

查看插件文档

重试与回退

针对指定的上游故障配置有限次数的重试和回退策略,无需更改应用访问端点。

查看插件文档

提示词与内容控制

使用 Prompt Guard 配置允许与拒绝规则,并按需组合模板、装饰或内容审核插件。

查看插件文档

AI 响应缓存

与 ai-proxy 或 ai-proxy-multi 配合,使用 Redis 支持的精确匹配和可选语义匹配缓存完整的 LLM 响应。

查看插件文档

Lakera Guard 集成

与 ai-proxy 或 ai-proxy-multi 配合,使用 Lakera Guard v2 API 检查受支持的 LLM 请求、响应或两者。

查看插件文档

模型选择

连接已支持及 OpenAI 兼容的提供商

连接 AI Proxy 插件文档列出的提供商,或通过 OpenAI 兼容端点接入其他托管或自主管理的服务。提供商选择由你配置的路由策略决定。

了解 AI 网关能力 什么是 AI 网关? 阅读 AI 网关学习指南 查看 AI 代理插件文档
支持的 LLM 提供商