Avaliação não é etapa final: o loop duplo que decide se um agente de IA vai pra produção

O case da Zepto usando MLflow mostra um padrão generalizável, dois loops separados, um de desenvolvimento e um de produção, ligados por um portão de qualidade, mais dataset dourado que cresce com o tempo e amostragem estratificada por risco em vez de amostragem uniforme. É engenharia de avaliação, não só uma métrica de acurácia isolada.

setembro 10, 2026 · 6 min · 1217 words · Wiliam Rosa

Antes de abrir o Grafana: como a Databricks usa agente de IA pra investigar o próprio incidente

A Databricks documentou o AI SRE, agente interno que roda checagem de plataforma, análise de log e runbook de time em paralelo assim que um incidente dispara, entregando causa raiz com evidência rastreável antes de um engenheiro terminar de montar o contexto manualmente.

agosto 25, 2026 · 6 min · 1180 words · Wiliam Rosa

Cinco alavancas técnicas pra baixar o custo de coding agent sem cortar acesso do time

Orçamento é só uma parte da conta de coding agent em escala. A Databricks lista cinco alavancas técnicas, roteamento dinâmico por modelo mais barato, meta-harness pra trocar de modelo sem fricção, e redução de token via cache e compressão de contexto, que reduziram custo em até 50% sem baixar qualidade percebida pelo engenheiro.

agosto 8, 2026 · 6 min · 1154 words · Wiliam Rosa

Por que um agente que já conhece seu catálogo vence um agente de código genérico em tarefa de dado

Um benchmark interno da Databricks com 401 tarefas reais de descoberta de dado mostra o Genie Code batendo agentes de código genéricos em acurácia e custo, e a explicação não é o modelo por trás, é o agente não precisar explorar o workspace às cegas.

julho 24, 2026 · 6 min · 1166 words · Wiliam Rosa