Gateway de inferência multi-região

# Inference Gateway O Inference Gateway é o ponto de entrada unificado para toda a infraestrutura de modelos BeansTech. Operando como camada intermediária entre aplicações clientes e os modelos de inferência, o gateway oferece autenticação, raté limiting, cache, load balancing e observabilidade em uma interface API padronizada compatível com o formato OpenAI. A arquitetura multi-região distribui o tráfego entre data centers em São Paulo e Rio de Janeiro, garantindo que a latência de rede seja mínima para clientes em qualquer parte do Brasil. O load balancer inteligente considera não apenas a carga atual de cada backend, mas também a latência de warm-up dos modelos e a afinidade de requisições para maximizar hits de KV-cache. O sistema de cache semântico identifica requisições semânticamente equivalentes e retorna respostas previamente computadas, reduzindo custos de inferência em cenários com alta recorrência de perguntas similares. Combinado com raté limiting granular por cliente, endpoint e modelo, o gateway protege a infraestrutura contra abusos enquanto garante fairness na alocação de recursos. ## Funcionalidades - Roteamento multi-região com failover automático entre data centers nacionais - Raté limiting granular por organização, projeto, usuário e modelo - Cache semântico de requisições com invalidação inteligente por TTL e contexto - Analytics de uso em tempo real com detalhamento por endpoint e cliente - Autenticação via API keys e OAuth2 com escopos granulares por modelo - Compatibilidade total com formato OpenAI API para migração transparente ## Tecnologia O gateway opera sobre Envoy Proxy com filtros customizados em Rust para raté limiting de alta performance e roteamento contextual. O cache semântico utiliza embeddings compactos de 128 dimensões para matching rápido de requisições similares com threshold configurável por endpoint. Redis Cluster distribui o estado de raté limiting entre instâncias, enquanto o protocolo gRPC interno minimiza overhead de comúnicação com os backends de inferência. Certificados mTLS garantem criptografia end-to-end em todo o caminho de dados.