A maioria das empresas coloca IA em produção rezando. Eu prefiro blindar.
Toda semana recebo mensagem no WhatsApp com a mesma história: "d.Biaggio, a gente subiu um agente de IA em produção e tá dando problema." Quando pergunto o que eles fizeram de hardening antes do deploy, o silêncio é ensurdecedor.
Vou ser direto: se você pegou um notebook do Jupyter, embrulhou numa API Flask e mandou pro Kubernetes achando que tá pronto, você não tem IA em produção. Você tem uma bomba-relógio com endpoint público.
Este artigo é o checklist que eu uso em consultoria. São 14 pontos de hardening que separam um PoC que funciona no demo day de um pipeline que aguenta o mundo real sem te acordar de madrugada.
PoC versus produção: dois mundos completamente diferentes
No PoC, tudo funciona. O modelo responde bonito, o demo impressiona o C-level, todo mundo bate palma. Mas produção é outro bicho.
Em produção você tem:
- Usuários reais fazendo coisas que nenhum prompt engineer imaginou
- Escala imprevisível — de 10 requisições por minuto para 10.000
- Custos que explodem quando o agente entra em loop e ninguém percebe
- Atacantes tentando prompt injection desde o dia 1
- Compliance exigindo que você prove quem acessou o quê e quando
A diferença entre PoC e produção é a diferença entre dirigir numa pista vazia e dirigir na Marginal Tietê às 18h. O carro é o mesmo. O contexto muda tudo.
Se você não tem pelo menos 10 dos 14 pontos abaixo implementados, sua IA não está pronta para produção. Ponto.
Os 14 pontos de hardening para IA em produção
1 RBAC e least privilege
Seu agente de IA não precisa de cluster-admin. Nenhum componente do pipeline precisa. Aplique Role-Based Access Control com o princípio do menor privilégio em tudo: acesso a APIs de LLM, bancos de dados, secrets, volumes. Se o agente só precisa ler de um bucket S3, ele não escreve. Se ele só chama a API da OpenAI, ele não tem acesso à AWS root. Isso é básico, mas quase ninguém faz.
2 Network policies
Isole seu pipeline de IA na rede. O pod que roda o agente não precisa falar com a internet inteira. Use NetworkPolicy no Kubernetes (ou security groups na AWS/GCP) para permitir apenas o tráfego necessário. Egress para a API do modelo, ingress do seu API gateway, e nada mais. Se o agente for comprometido, o blast radius fica contido.
3 Rate limiting
Sem rate limiting, um único usuário (ou atacante) pode consumir sua cota inteira de tokens em minutos. Implemente rate limiting em múltiplas camadas: no API gateway (requests/segundo por usuário), no service mesh (circuit breaking por upstream), e na aplicação (tokens/minuto por sessão). Use 429 Too Many Requests e retorne headers de Retry-After. Seu CFO vai te agradecer.
4 Cost guardrails
Este é o ponto que mais dói no bolso quando esquecido. Configure alertas de custo por pipeline, por agente, por hora. Defina hard limits: se o gasto com tokens passa de X reais em uma janela de 1 hora, a execução para. Use budgets da cloud provider + alertas customizados no Prometheus. Eu já vi um agente em loop gastar R$ 47.000 em um fim de semana porque ninguém colocou um teto.
5 Circuit breakers
Quando a API do modelo começa a retornar 500 ou latência de 30s, seu sistema precisa reagir. Circuit breakers (padrão popularizado pelo Hystrix e hoje implementado em qualquer service mesh) cortam chamadas para um serviço degradado antes que o problema cascateie. Configure thresholds: se 50% das chamadas falharem em uma janela de 30s, o circuito abre e o fallback assume.
6 Fallback chains
Se o GPT-4 cai, o que acontece? Se você não tem resposta, você não tem produção. Implemente uma cadeia de fallback: modelo primário (GPT-4o) -> modelo secundário (Claude) -> modelo local (Llama via Ollama) -> resposta estática. Cada nível degrada graciosamente. O usuário recebe algo útil mesmo no pior cenário. O sistema não morre.
7 Input validation: prompt injection e PII
Toda entrada do usuário que toca no prompt é um vetor de ataque. Implemente validação em duas frentes: prompt injection detection (classifique inputs suspeitos antes de enviar ao modelo) e PII stripping (remova CPF, email, telefone, dados sensíveis antes do input chegar ao LLM). Use regex para o básico e um classificador leve (como o de prompt injection da Rebuff ou similar) para ataques mais sofisticados. Nunca confie no input do usuário. Nunca.
8 Output validation
Tão importante quanto validar a entrada é validar a saída. O modelo pode alucinar, vazar dados do contexto, gerar conteúdo tóxico ou simplesmente retornar JSON malformado que quebra seu frontend. Implemente guardrails de saída: validação de schema, filtros de toxicidade, checagem de conformidade com as regras do seu negócio. Se a saída não passa nos checks, ela não chega ao usuário.
9 Observability com OpenTelemetry
Você não pode blindar o que não enxerga. Instrumente seu pipeline com OpenTelemetry: traces distribuídos que mostram a jornada completa de uma requisição (do input do usuário até a resposta do modelo e de volta). Cada span deve capturar latência, tokens usados, modelo chamado, e status. Exporte para Jaeger, Grafana Tempo ou Datadog. Sem isso, debugar problema em produção vira adivinhação.
10 Prometheus metrics
Além de traces, você precisa de métricas agregadas. Exponha métricas Prometheus do seu pipeline: ai_request_duration_seconds, ai_tokens_total, ai_errors_total, ai_cost_dollars, ai_fallback_activations_total. Crie dashboards no Grafana que mostrem a saúde do pipeline em tempo real. Se você não mede, você não gerencia.
11 Alertas: SLO breach, cost spike e agent loop
Métricas sem alertas são dashboards bonitos que ninguém olha. Configure três alertas críticos no mínimo: SLO breach (se a latência p99 passa de 5s ou a taxa de erro passa de 1%), cost spike (se o gasto por hora sobe mais de 200% da baseline), e agent loop (se o mesmo agente faz mais de N chamadas ao modelo em uma única execução). Mande para Slack, PagerDuty, ou o que seu time usa. Mas mande.
12 Human-in-the-loop
Nem toda decisão deve ser automatizada. Para ações de alto impacto (deletar dados, enviar email para cliente, aprovar transação financeira), implemente um gate de aprovação humana. O agente propõe a ação, um humano aprova ou rejeita. Isso não é fraqueza do sistema — é maturidade. Comece com human-in-the-loop para tudo e vá relaxando conforme a confiança aumenta.
13 Audit log
Quem chamou o quê, quando, com qual input, e qual foi o output. Registre tudo em um audit log imutável. Isso é obrigatório para compliance (LGPD, SOC2), para debugging post-mortem, e para treinar modelos melhores no futuro. Use structured logging (JSON), envie para um data lake ou sistema de SIEM, e defina políticas de retenção. Se der problema, o audit log é sua fonte da verdade.
14 Load testing e chaos engineering
Não espere o Black Friday para descobrir que seu pipeline não aguenta carga. Rode load tests com ferramentas como k6 ou Locust simulando padrões reais de uso. Depois, faça chaos engineering: mate o pod do modelo, simule latência alta na API, injete erros 500 aleatórios. Veja como seus circuit breakers, fallbacks e alertas se comportam. Se o sistema sobrevive ao caos controlado, ele sobrevive à produção real.
Conclusão: blindar não é opcional
Esses 14 pontos não são nice-to-have. São o mínimo para quem leva IA em produção a sério. Não adianta ter o modelo mais avançado do mercado se ele roda num pipeline frágil, sem observabilidade, sem guardrails, sem fallback.
A boa notícia: você não precisa implementar tudo de uma vez. Comece pelos pontos 1 (RBAC), 3 (rate limiting), 7 (input validation), 9 (observability) e 11 (alertas). Esses cinco já cobrem os cenários mais críticos. Depois vá adicionando os outros.
A má notícia: se você não começar agora, vai começar depois de um incidente em produção. E incidente em produção com IA é diferente — pode vazar dado sensível, pode custar dezenas de milhares de reais em tokens, pode tomar decisões erradas que afetam pessoas reais.
Não coloque IA em produção rezando. Blinde.
Quer ajuda para blindar seu pipeline?
Eu faço audit de pipelines de IA e implemento esses 14 pontos com seu time. Se você tá levando IA para produção e quer dormir tranquilo, vamos conversar.
Falar com d.Biaggio no WhatsAppBaixe o checklist em PDF
Os 14 pontos em formato checklist para imprimir, colar na parede do time e usar no próximo deploy. Grátis.
Sem spam. Só conteúdo técnico sobre IA em produção.