🤖 LLM Inference Service
API resiliente e assíncrona de inferência para aplicações baseadas em LLMs, desenvolvida em Python e FastAPI com integração multi-provider entre Groq e Gemini. Implementa retries com exponential backoff e jitter, timeouts, controle de concorrência por provider, model fallback e provider fallback com proteção contra ciclos. Inclui rate limiting por cliente, classificação e normalização de erros dos provedores, validação tipada de configurações e requisições, rastreamento por request ID e métricas de tokens e latência. O projeto possui frontend público integrado e uma suíte com 44 testes automatizados.