Avaliação não é etapa final: o loop duplo que decide se um agente de IA vai pra produção

O case da Zepto usando MLflow mostra um padrão generalizável, dois loops separados, um de desenvolvimento e um de produção, ligados por um portão de qualidade, mais dataset dourado que cresce com o tempo e amostragem estratificada por risco em vez de amostragem uniforme. É engenharia de avaliação, não só uma métrica de acurácia isolada.

setembro 10, 2026 · 6 min · 1217 words · Wiliam Rosa

Agente que sobrevive à queda de worker: durabilidade real combinando Temporal e Lakebase

Agente de IA de longa duração falha de um jeito diferente de API request-response: o processo pode cair no meio de uma etapa que já produziu efeito parcial. Um projeto de referência combina Temporal para reexecução determinística de workflow com Lakebase Postgres para estado operacional consultável, mas a idempotência de cada passo continua sendo responsabilidade de quem escreve o código do agente.

setembro 9, 2026 · 6 min · 1128 words · Wiliam Rosa

Genie Agents ganha modo de pesquisa em múltiplos passos e aprende a ler arquivo, não só tabela

Agent mode traz raciocínio em múltiplos passos com relatório e visualização, Genie Agents passa a ler PDF, slide e imagem dentro de volume do Unity Catalog, e o Genie Code ganha função pra criar e diagnosticar outros agentes Genie.

setembro 2, 2026 · 2 min · 406 words · Wiliam Rosa

Skill de agente virou um objeto do Unity Catalog, com dono, permissão e auditoria

Unity Catalog Skills (Beta) trata skill de agente como securable de três níveis, catalog.schema.skill, com as mesmas permissões e tags que já protegem tabela. O Databricks MVP Hubert Dudek notou a mudança antes do anúncio oficial confirmar.

agosto 29, 2026 · 2 min · 287 words · Wiliam Rosa

Antes de abrir o Grafana: como a Databricks usa agente de IA pra investigar o próprio incidente

A Databricks documentou o AI SRE, agente interno que roda checagem de plataforma, análise de log e runbook de time em paralelo assim que um incidente dispara, entregando causa raiz com evidência rastreável antes de um engenheiro terminar de montar o contexto manualmente.

agosto 25, 2026 · 6 min · 1180 words · Wiliam Rosa

Por que um agente que já conhece seu catálogo vence um agente de código genérico em tarefa de dado

Um benchmark interno da Databricks com 401 tarefas reais de descoberta de dado mostra o Genie Code batendo agentes de código genéricos em acurácia e custo, e a explicação não é o modelo por trás, é o agente não precisar explorar o workspace às cegas.

julho 24, 2026 · 6 min · 1166 words · Wiliam Rosa