什么是 AI 网关?
AI Gateway 是一个集成平台,旨在管理 AI 网关的完整生命周期以及流经它们的 AI 流量——包括 LLM 提供者调用、模型上下文协议 (MCP) 交换和 AI 代理工作流——跨企业 Kubernetes 环境。它提供了一套集中工具,用于创建、修改、安全、部署和监控多个集群和项目中的网关。与其说这是一个通用的 API 网关,附加了 AI 功能,不如说这个平台是建立在 agentgateway 之上——一个以 AI 为先的代理,原生支持 OpenAI 兼容的端点、MCP 服务器和代理到代理 (A2A) 通信,作为 Rust 数据平面由 Go 控制平面进行编排。
关键组件和功能包括:
- Gateway Lifecycle Management: 创建、配置、版本和部署 agentgateway 实例,完全控制监听器(主机/端口/协议)、TLS 终止、基础设施参数(镜像、CPU/内存、副本、HPA、PDB、日志记录)和监听器暴露模式(direct LoadBalancer 或 ingress 模式)跨多个 Kubernetes 集群。
- Multi-Backend Support: 通过单个 AgentgatewayBackend 资源管理多种后端类型:ai (LLM 提供者,如 OpenAI、Anthropic、Bedrock、Azure OpenAI、Gemini、Vertex AI)、mcp (通过 SSE/StreamableHTTP 的模型上下文协议服务器)、static (REST 端点和 K8s 服务)以及 dynamicForwardProxy(在运行时从 Host 头解析的目标)。
- Project-Based Isolation: 每个项目作为一个独立的单元,拥有自己的网关、后端、路由、策略和秘密,范围在一个集中化的领域下。集群、命名空间和项目上下文在API层强制执行,支持安全的多租户操作,同时为平台管理员保留跨项目的可见性。
- AI Policy Management: 应用集中化策略进行身份验证(JWT、API密钥、基于CEL的授权)、速率限制、提示保护(请求和响应检查)、响应缓存、转换、重试、超时、头部修改和特定于AI的保护措施——所有这些都可以通过统一的 AgentgatewayPolicy CRD 在网关、HTTPRoute或后端级别附加。
- AI Provider Failover & Load Balancing: 在 backend.ai 内配置多提供者路由,使用 priority + weight 组进行自动故障转移(例如,OpenAI主节点 → Anthropic备用)和同一优先级层内的加权负载均衡。支持基于模型名称的路由,网关检查请求体中的 model 字段并调度到匹配的后端——使单个兼容OpenAI的端点能够透明地服务多个提供者。
- Topology Visualization: 一个自动渲染的交互式图表(Vue Flow + Dagre),显示网关 ↔ HTTPRoute ↔ 后端 ↔ 策略关系,带有可点击的详细面板,帮助操作员追踪请求的端到端流动,并理解任何配置更改的影响。
- Logging and Monitoring: 检查每个请求的审计事件(每个API的 /events 端点),跟踪每个项目/每个模型的使用情况,并通过内置监控仪表板显示延迟和错误指标——为操作员提供对配置平面(谁更改了什么)和运行时平面(什么流量流向哪里)的可见性。

AI 网关的目的
随着企业越来越多地采用基于 AI 的服务,AI 流量的数量和复杂性急剧增加。请求现在跨越多个 AI 模式——LLM 提供者调用、MCP 交换和代理工作流——并在许多 Kubernetes 集群和项目中运行。这带来了显著的操作、安全和治理挑战:
- 团队必须在集群之间管理具有一致配置(监听器、TLS、扩展、日志记录、部署设置)的网关,这在按团队或按环境进行时难以标准化且容易出错。
- 后端类型和提供者(与 OpenAI 兼容的 LLM、MCP 服务器、内部 REST 服务、动态转发代理目标)的数量不断增加,使路由和端点管理变得越来越分散。
- 跨项目的多租户操作需要强隔离(每个项目的独立网关、路由、策略和机密),同时仍然允许平台管理员维护跨项目的可见性和控制。
- 如果没有集中式政策管理,身份验证(JWT/API 密钥/CEL 授权)、速率限制、提示保护、缓存、转换、重试和超时等控制措施将不一致地实施,从而导致安全漏洞和不可预测的服务行为。
- 随着使用量的增加,提供者的可靠性和成本管理变得更加困难;企业需要内置的故障转移和在多个 AI 提供者之间的加权负载均衡,包括在单个与 OpenAI 兼容的端点后面的基于模型的路由。
- 缺乏统一的可观察性——请求审计事件、按项目/模型的使用情况、延迟/错误指标——以及较差的拓扑可见性使得理解端到端的流量流动、评估变更的影响和快速故障排除变得困难。 这些挑战突显了需要一个统一的、原生AI网关平台,以标准化企业中AI流量的安全、路由、管理和监控方式。AI Gateway通过提供代理网关部署的集中生命周期管理、在多个附加点(网关/路由/后端)的一致政策执行、灵活的多后端路由及故障转移,以及清晰的拓扑和监控,来解决这一问题——使团队能够快速行动,同时保持在企业安全和运营标准之内。
关键好处
AI Gateway系统增强了AI服务的可靠性和运营效率。其主要好处包括:
- Unified AI Traffic Management: 通过单一平台提供所有AI流量的端到端管理,简化路由、身份验证和政策执行。
- Scalability & Flexibility: 支持多集群和多项目环境,实现服务隔离、团队自主性,并与内部和外部AI服务提供商无缝集成。
- Centralized Policy Governance: 在整个企业中一致地执行政策,减少配置错误的风险,并确保企业合规。
- Enhanced Security:管理证书和API密钥的生命周期,以最小化人工错误和安全风险。
- Operational Efficiency:提供可视化、可重用模板和批量管理工具,以减少开销并加速故障排除。
- Consistent Observability: 提供可视化拓扑、流量流动和所有组件的状态,便于快速故障排除和运营透明度。
简而言之,AI Gateway 系统使组织能够安全、高效和透明地管理 AI 流量,支持现代 AI 驱动企业中的创新和合规。