Hybrid Inference Architecture & 2-Tier Smart Failover

Estratégia de 3 Camadas: Operação Online 0 MB VRAM, Failover Nível 1 Ollama e Nível 2 LM Studio MoE

Hybrid Inference Architecture & 2-Tier Smart Failover Estratégia de 3 Camadas: Operação Online 0 MB VRAM, Failover Nível 1 Ollama e Nível 2 LM Studio MoE Ambiente Local Host Windows (Failover Reativo Sob Demanda) PaperClip Squad · 15 Agentes IA (:3100) · Architecture component PaperClip Squad 15 Agentes IA (:3100) OmniRoute Gateway · AI Gateway :20130 (EBITDA Shield) · Architecture component · Orquestrador OmniRoute Gateway AI Gateway :20130 (EBITDA Shield) Orquestrador Cloud Free Tier · OpenRouter / Nuvem (0 MB VRAM) · Architecture component · Primário Online Cloud Free Tier OpenRouter / Nuvem (0 MB VRAM) Primário Online Ollama Local (Nível 1) · qwen2.5-coder:7b (:11434) · Ambiente Local Host Windows (Failover Reativo Sob Demanda) · 100% VRAM Ollama Local (Nível 1) qwen2.5-coder:7b (:11434) 100% VRAM LM Studio (Nível 2) · DeepSeek-Coder-V2 MoE (:1234) · Ambiente Local Host Windows (Failover Reativo Sob Demanda) · GPU Offload LM Studio (Nível 2) DeepSeek-Coder-V2 MoE (:1234) GPU Offload NVIDIA RTX 3050 · 6GB VRAM + 16GB RAM DDR5 · Ambiente Local Host Windows (Failover Reativo Sob Demanda) · Hardware Host NVIDIA RTX 3050 6GB VRAM + 16GB RAM DDR5 Hardware Host Watcher Daemon · PowerShell Trigger (.ps1) · Architecture component · Governança Watcher Daemon PowerShell Trigger (.ps1) Governança Req OpenAI Modo Online Ativo Failover Nível 1 Failover Nível 2 Aloca ~4.7 GB VRAM Offload VRAM + RAM Detecção de Queda Legend Frontend Backend Cloud Database Security

Operação Online Primária

  • • Custo marginal zero com provedores Cloud Free Tier e OpenRouter
  • • A GPU física local permanece com 0 MB de VRAM alocada durante todo o expediente online

Failover Nível 1 (Ollama Local)

  • • Modelo especializado qwen2.5-coder:7b-instruct-q4_K_M
  • • Roda 100% alocado na VRAM de 6 GB da RTX 3050 para respostas ultra-rápidas

Failover Nível 2 (LM Studio MoE)

  • • DeepSeek-Coder-V2-Lite-Instruct (16B parâmetros / 2.4B ativos)
  • • GPU Offload dinâmico distribuindo camadas entre VRAM e 16 GB de RAM DDR5

Governança Reativa de Memória

  • • Scripts PowerShell on_offline_event e on_online_event
  • • Desalocação total imediata de memória ao restabelecer conexão (Retorno a 0 MB)