Avaliação não é etapa final: o loop duplo que decide se um agente de IA vai pra produção

O case da Zepto usando MLflow mostra um padrão generalizável, dois loops separados, um de desenvolvimento e um de produção, ligados por um portão de qualidade, mais dataset dourado que cresce com o tempo e amostragem estratificada por risco em vez de amostragem uniforme. É engenharia de avaliação, não só uma métrica de acurácia isolada.

setembro 10, 2026 · 6 min · 1217 words · Wiliam Rosa

Como ensinar um LLM a passar no teste de Spark SQL sem decorar a prova

Avaliar modelo de código em biblioteca de nicho como Spark SQL esbarra num problema básico: falta benchmark bom. Um pipeline de quatro estágios da Databricks gera caso de teste automaticamente a partir da própria função, com validação cruzada entre dois modelos, e revela que instrução simples como comentário de notebook do Azure Databricks muda o resultado do modelo de forma mensurável.

outubro 3, 2024 · 6 min · 1198 words · Wiliam Rosa