Testei o juiz de correção do MLflow e um 'ou' a menos virou a diferença entre passar e reprovar

O Databricks MVP Gary Nakanelua testou o juiz de correção do MLflow contra duas Foundation Model APIs e descobriu que remover uma única palavra de um fato esperado, sem mudar a resposta do modelo, foi suficiente pra virar o veredito de reprovado pra aprovado.

setembro 14, 2026 · 2 min · 397 words · Wiliam Rosa