OmniRoute LLM Request Lifecycle & EBITDA Shield

Proxy de Inferência, Cache de Prompts e Fallback Dinâmico Cloud / GPU Local

OmniRoute LLM Request Lifecycle & EBITDA Shield Proxy de Inferência, Cache de Prompts e Fallback Dinâmico Cloud / GPU Local POST /v1/chat/completions Lookup Hash no Prompt Cache Cache Miss / Hit Result Failover Local -> Qwen 2.5 / DeepSeek MoE Resposta ou GPU Unavailable Fallback -> Gemini 3.1 Pro / Claude 3.5 Token Stream + Meta Metrics HTTP 200 OK + Completion Data Verificação de Cache & Triagem Roteamento Primário (GPU Local) Fallback High Logic (Cloud LLM) Cliente · PaperClip / IDE · Sequence participant Cliente PaperClip / IDE OmniRoute · AI Gateway :20130 · Sequence participant OmniRoute AI Gateway :20130 Cache EBITDA · Prompt Cache · Sequence participant Cache EBITDA Prompt Cache GPU Local · Ollama / LM Studio · Sequence participant GPU Local Ollama / LM Studio Cloud LLM · Gemini / Claude API · Sequence participant Cloud LLM Gemini / Claude API Legend request return security async trace

EBITDA Shield

  • • Minimiza custos de API interceptando chamadas idênticas
  • • Prompt caching inteligente reduz latência para milissegundos

Resiliência Multi-Tier

  • • Chaveamento transparente de Tier-3 (Local GPU) para Tier-1 (Cloud)
  • • Recuperação automática sem falhar a requisição do agente

Métricas de Consumo

  • • Auditoria completa de tokens e custo estimado gravada em log
  • • Conexão de alta velocidade com o PaperClip Dashboard