Como ensinar um LLM a passar no teste de Spark SQL sem decorar a prova

Avaliar modelo de código em biblioteca de nicho como Spark SQL esbarra num problema básico: falta benchmark bom. Um pipeline de quatro estágios da Databricks gera caso de teste automaticamente a partir da própria função, com validação cruzada entre dois modelos, e revela que instrução simples como comentário de notebook do Azure Databricks muda o resultado do modelo de forma mensurável.

outubro 3, 2024 · 6 min · 1198 words · Wiliam Rosa

Streaming não é sobre velocidade máxima, é sobre acertar o relógio certo pra cada dado

A divisão rígida entre pipeline batch e pipeline streaming é mais uma escolha de ferramenta antiga do que uma necessidade real: Spark Structured Streaming trata os dois casos como pontos no mesmo espectro de latência, com o mesmo motor, o mesmo código e as mesmas garantias de tolerância a falha.

novembro 10, 2023 · 6 min · 1102 words · Wiliam Rosa

Gestão de custo no Databricks é decisão de política de cluster, não corte de orçamento no fim do mês

Controlar gasto no Databricks funciona melhor como restrição estrutural definida em cluster policy, autoscaling e auto-termination, do que como auditoria reativa de fatura no fim do mês. O trade-off central é entre restringir demais e travar produtividade, ou liberar demais e perder controle de custo.

outubro 19, 2022 · 6 min · 1120 words · Wiliam Rosa