<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/">
  <channel>
    <title>Data Engineering on Wiliam Rosa | Lakehouse, Dados &amp; IA</title>
    <link>https://wiliamrosa.github.io/tags/data-engineering/</link>
    <description>Recent content in Data Engineering on Wiliam Rosa | Lakehouse, Dados &amp; IA</description>
    <image>
      <title>Wiliam Rosa | Lakehouse, Dados &amp; IA</title>
      <url>https://wiliamrosa.github.io/images/wiliam-rosa-blog-og.png</url>
      <link>https://wiliamrosa.github.io/images/wiliam-rosa-blog-og.png</link>
    </image>
    <generator>Hugo</generator>
    <language>pt-br</language>
    <lastBuildDate>Fri, 11 Sep 2026 10:00:00 -0300</lastBuildDate>
    <atom:link href="https://wiliamrosa.github.io/tags/data-engineering/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>Marketing parou de precisar de conector customizado pra cada plataforma de anúncio</title>
      <link>https://wiliamrosa.github.io/posts/lakeflow-connect-dados-marketing-unificados/</link>
      <pubDate>Fri, 11 Sep 2026 10:00:00 -0300</pubDate>
      <guid>https://wiliamrosa.github.io/posts/lakeflow-connect-dados-marketing-unificados/</guid>
      <description>A Databricks reuniu mais de 15 conectores gerenciados do Lakeflow Connect cobrindo aquisição, engajamento, relacionamento e experiência do cliente, com tabela pronta de gasto e conversão pra plataforma de anúncio direto em Delta table.</description>
    </item>
    <item>
      <title>O que realmente separa uma managed table de uma external table no Unity Catalog</title>
      <link>https://wiliamrosa.github.io/posts/unity-catalog-managed-tables-entendendo/</link>
      <pubDate>Fri, 11 Sep 2026 09:00:00 -0300</pubDate>
      <guid>https://wiliamrosa.github.io/posts/unity-catalog-managed-tables-entendendo/</guid>
      <description>Um artigo do Youssef Mrini, destacado pelo Databricks MVP Jacek Laskowski, revisita um ponto que ainda confunde muita gente: managed table não é só &amp;rsquo;tabela sem LOCATION&amp;rsquo;, é a Databricks assumindo o ciclo de vida inteiro do dado.</description>
    </item>
    <item>
      <title>📖 Livro: Lakehouse Engineering com Databricks</title>
      <link>https://wiliamrosa.github.io/posts/livro-lakehouse-engineering-com-databricks/</link>
      <pubDate>Mon, 31 Aug 2026 23:00:00 -0300</pubDate>
      <guid>https://wiliamrosa.github.io/posts/livro-lakehouse-engineering-com-databricks/</guid>
      <description>Meu livro Lakehouse Engineering com Databricks já está disponível em eBook e impresso: pipelines modernos com Spark, Delta Lake e Unity Catalog, alinhado ao exame Databricks Certified Data Engineer Associate.</description>
    </item>
    <item>
      <title>✅ Aprovado no exame DP-750: Azure Databricks Data Engineer Associate</title>
      <link>https://wiliamrosa.github.io/posts/certificacao-dp-750-azure-databricks-data-engineer-associate/</link>
      <pubDate>Mon, 31 Aug 2026 22:35:00 -0300</pubDate>
      <guid>https://wiliamrosa.github.io/posts/certificacao-dp-750-azure-databricks-data-engineer-associate/</guid>
      <description>Fui aprovado no exame Databricks Data Engineer Associate (DP-750), voltado para engenharia de dados no ecossistema Azure com foco em Azure Databricks.</description>
    </item>
    <item>
      <title>Detectar dado corrompido em menos de 1 milissegundo: o que muda quando o Spark para de esperar o próximo micro-batch</title>
      <link>https://wiliamrosa.github.io/articles/spark-real-time-mode-deteccao-anomalias-blockchain/</link>
      <pubDate>Tue, 14 Jul 2026 09:00:00 -0300</pubDate>
      <guid>https://wiliamrosa.github.io/articles/spark-real-time-mode-deteccao-anomalias-blockchain/</guid>
      <description>O Apache Spark Real-Time Mode processa evento por evento em vez de esperar o próximo micro-batch fechar, e um experimento publicado pela Databricks usando transações da blockchain Ethereum mostrou latência p99 abaixo de 1 milissegundo classificando dado como válido ou suspeito em tempo real.</description>
    </item>
    <item>
      <title>Clean Rooms empacotados: como rodar o algoritmo de um parceiro sem nunca ver o código dele</title>
      <link>https://wiliamrosa.github.io/articles/clean-rooms-empacotados-provedor-consumidor/</link>
      <pubDate>Fri, 19 Jun 2026 09:00:00 -0300</pubDate>
      <guid>https://wiliamrosa.github.io/articles/clean-rooms-empacotados-provedor-consumidor/</guid>
      <description>O modo &amp;rsquo;empacotado&amp;rsquo; das Clean Rooms do Azure Databricks separa o papel de provedor (que traz o algoritmo e nunca expõe o código) do papel de consumidor (que traz o dado e nunca vê a lógica), permitindo cruzar identidade ou fazer matching entre empresas sem que nenhum dos dois lados abra mão do que é proprietário.</description>
    </item>
    <item>
      <title>1 petabyte em menos de 24 horas: o que acontece quando você tira a partição fixa do meio do caminho</title>
      <link>https://wiliamrosa.github.io/articles/zerobus-ingest-particionamento-dinamico-petabyte/</link>
      <pubDate>Fri, 12 Jun 2026 09:00:00 -0300</pubDate>
      <guid>https://wiliamrosa.github.io/articles/zerobus-ingest-particionamento-dinamico-petabyte/</guid>
      <description>A Databricks publicou um teste de carga do Zerobus Ingest usando o dataset NASA NEOWISE, sustentando 12 milhões de linhas por segundo e ingerindo mais de 1 trilhão de registros em 24 horas. O truque estrutural é deslocar a garantia de ordenação da partição fixa para a conexão de stream, permitindo autoscaling real de pods sem repensar o esquema de particionamento.</description>
    </item>
    <item>
      <title>Nem tudo precisa da mesma granularidade: como separar SLA por fluxo derrubou custo de dado em 50x</title>
      <link>https://wiliamrosa.github.io/articles/octopus-energy-arquitetura-multi-grain-custo-dados/</link>
      <pubDate>Sun, 24 May 2026 09:00:00 -0300</pubDate>
      <guid>https://wiliamrosa.github.io/articles/octopus-energy-arquitetura-multi-grain-custo-dados/</guid>
      <description>A Octopus Energy reduziu de 25 bilhões pra 300 milhões de linhas processadas trocando um pipeline mensal monolítico por três fluxos independentes de granularidade diferente, usando Change Data Feed, dbt incremental e Adaptive Query Execution. O custo por dado de liquidação MHHS caiu de cerca de 23 dólares pra menos de 50 centavos.</description>
    </item>
    <item>
      <title>Como ensinar um LLM a passar no teste de Spark SQL sem decorar a prova</title>
      <link>https://wiliamrosa.github.io/articles/geracao-testes-codigo-llm-spark-sql/</link>
      <pubDate>Thu, 03 Oct 2024 09:00:00 -0300</pubDate>
      <guid>https://wiliamrosa.github.io/articles/geracao-testes-codigo-llm-spark-sql/</guid>
      <description>Avaliar modelo de código em biblioteca de nicho como Spark SQL esbarra num problema básico: falta benchmark bom. Um pipeline de quatro estágios da Databricks gera caso de teste automaticamente a partir da própria função, com validação cruzada entre dois modelos, e revela que instrução simples como comentário de notebook do Azure Databricks muda o resultado do modelo de forma mensurável.</description>
    </item>
  </channel>
</rss>
