Marketing parou de precisar de conector customizado pra cada plataforma de anúncio

A Databricks reuniu mais de 15 conectores gerenciados do Lakeflow Connect cobrindo aquisição, engajamento, relacionamento e experiência do cliente, com tabela pronta de gasto e conversão pra plataforma de anúncio direto em Delta table.

setembro 11, 2026 · 2 min · 357 words · Wiliam Rosa

O que realmente separa uma managed table de uma external table no Unity Catalog

Um artigo do Youssef Mrini, destacado pelo Databricks MVP Jacek Laskowski, revisita um ponto que ainda confunde muita gente: managed table não é só ’tabela sem LOCATION’, é a Databricks assumindo o ciclo de vida inteiro do dado.

setembro 11, 2026 · 2 min · 344 words · Wiliam Rosa
Capa do livro Lakehouse Engineering com Databricks - Certificação, Arquitetura e Casos Reais

📖 Livro: Lakehouse Engineering com Databricks

Meu livro Lakehouse Engineering com Databricks já está disponível em eBook e impresso: pipelines modernos com Spark, Delta Lake e Unity Catalog, alinhado ao exame Databricks Certified Data Engineer Associate.

agosto 31, 2026 · 1 min · 196 words · Wiliam Rosa
DP-750 - Azure Databricks Data Engineer Associate - Microsoft Certified

✅ Aprovado no exame DP-750: Azure Databricks Data Engineer Associate

Fui aprovado no exame Databricks Data Engineer Associate (DP-750), voltado para engenharia de dados no ecossistema Azure com foco em Azure Databricks.

agosto 31, 2026 · 1 min · 81 words · Wiliam Rosa

Detectar dado corrompido em menos de 1 milissegundo: o que muda quando o Spark para de esperar o próximo micro-batch

O Apache Spark Real-Time Mode processa evento por evento em vez de esperar o próximo micro-batch fechar, e um experimento publicado pela Databricks usando transações da blockchain Ethereum mostrou latência p99 abaixo de 1 milissegundo classificando dado como válido ou suspeito em tempo real.

julho 14, 2026 · 6 min · 1091 words · Wiliam Rosa

Clean Rooms empacotados: como rodar o algoritmo de um parceiro sem nunca ver o código dele

O modo ’empacotado’ das Clean Rooms do Azure Databricks separa o papel de provedor (que traz o algoritmo e nunca expõe o código) do papel de consumidor (que traz o dado e nunca vê a lógica), permitindo cruzar identidade ou fazer matching entre empresas sem que nenhum dos dois lados abra mão do que é proprietário.

junho 19, 2026 · 7 min · 1400 words · Wiliam Rosa

1 petabyte em menos de 24 horas: o que acontece quando você tira a partição fixa do meio do caminho

A Databricks publicou um teste de carga do Zerobus Ingest usando o dataset NASA NEOWISE, sustentando 12 milhões de linhas por segundo e ingerindo mais de 1 trilhão de registros em 24 horas. O truque estrutural é deslocar a garantia de ordenação da partição fixa para a conexão de stream, permitindo autoscaling real de pods sem repensar o esquema de particionamento.

junho 12, 2026 · 6 min · 1083 words · Wiliam Rosa

Nem tudo precisa da mesma granularidade: como separar SLA por fluxo derrubou custo de dado em 50x

A Octopus Energy reduziu de 25 bilhões pra 300 milhões de linhas processadas trocando um pipeline mensal monolítico por três fluxos independentes de granularidade diferente, usando Change Data Feed, dbt incremental e Adaptive Query Execution. O custo por dado de liquidação MHHS caiu de cerca de 23 dólares pra menos de 50 centavos.

maio 24, 2026 · 6 min · 1070 words · Wiliam Rosa

Como ensinar um LLM a passar no teste de Spark SQL sem decorar a prova

Avaliar modelo de código em biblioteca de nicho como Spark SQL esbarra num problema básico: falta benchmark bom. Um pipeline de quatro estágios da Databricks gera caso de teste automaticamente a partir da própria função, com validação cruzada entre dois modelos, e revela que instrução simples como comentário de notebook do Azure Databricks muda o resultado do modelo de forma mensurável.

outubro 3, 2024 · 6 min · 1198 words · Wiliam Rosa