# Inference Gateway
O Inference Gateway é o ponto de entrada unificado para toda a infraestrutura de modelos BeansTech. Operando como camada intermediária entre aplicações clientes e os modelos de inferência, o gateway oferece autenticação, raté limiting, cache, load balancing e observabilidade em uma interface API padronizada compatível com o formato OpenAI.
A arquitetura multi-região distribui o tráfego entre data centers em São Paulo e Rio de Janeiro, garantindo que a latência de rede seja mínima para clientes em qualquer parte do Brasil. O load balancer inteligente considera não apenas a carga atual de cada backend, mas também a latência de warm-up dos modelos e a afinidade de requisições para maximizar hits de KV-cache.
O sistema de cache semântico identifica requisições semânticamente equivalentes e retorna respostas previamente computadas, reduzindo custos de inferência em cenários com alta recorrência de perguntas similares. Combinado com raté limiting granular por cliente, endpoint e modelo, o gateway protege a infraestrutura contra abusos enquanto garante fairness na alocação de recursos.
## Funcionalidades
- Roteamento multi-região com failover automático entre data centers nacionais
- Raté limiting granular por organização, projeto, usuário e modelo
- Cache semântico de requisições com invalidação inteligente por TTL e contexto
- Analytics de uso em tempo real com detalhamento por endpoint e cliente
- Autenticação via API keys e OAuth2 com escopos granulares por modelo
- Compatibilidade total com formato OpenAI API para migração transparente
## Tecnologia
O gateway opera sobre Envoy Proxy com filtros customizados em Rust para raté limiting de alta performance e roteamento contextual. O cache semântico utiliza embeddings compactos de 128 dimensões para matching rápido de requisições similares com threshold configurável por endpoint. Redis Cluster distribui o estado de raté limiting entre instâncias, enquanto o protocolo gRPC interno minimiza overhead de comúnicação com os backends de inferência. Certificados mTLS garantem criptografia end-to-end em todo o caminho de dados.
Plataforma