<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/">
  <channel>
    <title>Delta Lake on Wiliam Rosa | Lakehouse, Dados &amp; IA</title>
    <link>https://wiliamrosa.github.io/tags/delta-lake/</link>
    <description>Recent content in Delta Lake on Wiliam Rosa | Lakehouse, Dados &amp; IA</description>
    <image>
      <title>Wiliam Rosa | Lakehouse, Dados &amp; IA</title>
      <url>https://wiliamrosa.github.io/images/wiliam-rosa-blog-og.png</url>
      <link>https://wiliamrosa.github.io/images/wiliam-rosa-blog-og.png</link>
    </image>
    <generator>Hugo</generator>
    <language>pt-br</language>
    <lastBuildDate>Sun, 13 Sep 2026 08:00:00 -0300</lastBuildDate>
    <atom:link href="https://wiliamrosa.github.io/tags/delta-lake/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>OpenSharing agora compartilha tabela Iceberg e schema inteiro vindo de fonte externa via federação</title>
      <link>https://wiliamrosa.github.io/posts/opensharing-tabelas-iceberg-schemas-externos/</link>
      <pubDate>Sun, 13 Sep 2026 08:00:00 -0300</pubDate>
      <guid>https://wiliamrosa.github.io/posts/opensharing-tabelas-iceberg-schemas-externos/</guid>
      <description>Duas novidades GA no OpenSharing: compartilhar tabela Iceberg federada de catálogo externo via Lakehouse Federation, inclusive pra cliente Iceberg de fora do Databricks, sem copiar dado; e compartilhar schema ou tabela inteira federada de fonte externa, essa última materializando o dado do lado do provedor e gerando custo extra de compute e armazenamento.</description>
    </item>
    <item>
      <title>Databricks SQL ganhou tabela temporária de verdade, escopada por sessão e com limpeza automática</title>
      <link>https://wiliamrosa.github.io/posts/temporary-tables-databricks-sql/</link>
      <pubDate>Sun, 13 Sep 2026 07:45:00 -0300</pubDate>
      <guid>https://wiliamrosa.github.io/posts/temporary-tables-databricks-sql/</guid>
      <description>CREATE TEMPORARY TABLE cria uma tabela Delta física que existe só durante a sessão que a criou, com limite máximo de sete dias de vida, usando a mesma infraestrutura de cache e performance de uma tabela padrão, mas sem exigir limpeza manual nem poluir o catálogo com objeto de vida curta.</description>
    </item>
    <item>
      <title>SCOUT: como a Southern Company junta previsão, resposta e pós-tempestade num único lakehouse</title>
      <link>https://wiliamrosa.github.io/posts/southern-company-scout-storm-intelligence/</link>
      <pubDate>Thu, 03 Sep 2026 09:00:00 -0300</pubDate>
      <guid>https://wiliamrosa.github.io/posts/southern-company-scout-storm-intelligence/</guid>
      <description>SCOUT é o terceiro aplicativo da Southern Company sobre Databricks pra operação de tempestade, cobrindo o momento em tempo real entre a previsão (SPEAR) e a análise pós-evento (RAMP), com dado de outage, clima, terreno e equipe numa única camada.</description>
    </item>
    <item>
      <title>Change Data Feed automático chega à disponibilidade geral, sem precisar ligar nada tabela por tabela</title>
      <link>https://wiliamrosa.github.io/posts/auto-cdf-change-data-feed-automatico-ga/</link>
      <pubDate>Wed, 02 Sep 2026 09:00:00 -0300</pubDate>
      <guid>https://wiliamrosa.github.io/posts/auto-cdf-change-data-feed-automatico-ga/</guid>
      <description>Automatic Change Data Feed (Auto CDF) atingiu disponibilidade geral no Azure Databricks: calcula mudança de linha na hora da consulta usando row tracking, sem exigir habilitar change data feed manualmente em cada tabela.</description>
    </item>
    <item>
      <title>DeltaBus: o padrão que usa Delta Lake e Change Data Feed em vez de Kafka</title>
      <link>https://wiliamrosa.github.io/posts/deltabus-delta-lake-change-data-feed-sem-kafka/</link>
      <pubDate>Wed, 19 Aug 2026 09:00:00 -0300</pubDate>
      <guid>https://wiliamrosa.github.io/posts/deltabus-delta-lake-change-data-feed-sem-kafka/</guid>
      <description>Em vez de mais um cluster Kafka pra manter, o padrão DeltaBus usa tabela Delta e Change Data Feed como barramento de eventos. O Databricks MVP Dr. Alan L. Dennis destacou o argumento por trás dessa escolha de arquitetura.</description>
    </item>
    <item>
      <title>Índice de texto no Delta Lake: o que muda quando o Databricks para de escanear tudo pra achar uma palavra</title>
      <link>https://wiliamrosa.github.io/articles/databricks-indice-busca-textual-delta-lake/</link>
      <pubDate>Sat, 18 Jul 2026 09:00:00 -0300</pubDate>
      <guid>https://wiliamrosa.github.io/articles/databricks-indice-busca-textual-delta-lake/</guid>
      <description>O índice de busca textual do Unity Catalog (Beta na Databricks Runtime 18.2) deixa de varrer arquivo por arquivo atrás de uma palavra e passa a pular direto pra onde ela realmente está. O ganho de performance é real, mas vem com manutenção manual e uma lista de recursos incompatíveis que vale conhecer antes de sair criando índice em tudo.</description>
    </item>
    <item>
      <title>Databricks ainda não rastreia a evolução do schema de uma tabela, mas dá pra construir isso com Delta Lake</title>
      <link>https://wiliamrosa.github.io/posts/databricks-schema-evolution-audit-trail-delta/</link>
      <pubDate>Thu, 16 Jul 2026 09:00:00 -0300</pubDate>
      <guid>https://wiliamrosa.github.io/posts/databricks-schema-evolution-audit-trail-delta/</guid>
      <description>O Databricks MVP Jaco van Gelder construiu uma função PySpark que reconstrói o histórico completo de mudanças de schema de uma tabela, útil pra auditoria financeira, algo que o Databricks não oferece pronto.</description>
    </item>
    <item>
      <title>Reprocessar a tabela inteira só pra atualizar duas partições? Existe um padrão pra isso</title>
      <link>https://wiliamrosa.github.io/posts/databricks-liquid-clustering-dynamic-overwrite/</link>
      <pubDate>Thu, 02 Jul 2026 09:00:00 -0300</pubDate>
      <guid>https://wiliamrosa.github.io/posts/databricks-liquid-clustering-dynamic-overwrite/</guid>
      <description>O Databricks MVP Bartosz Konieczny detalha o Dynamic Data Overwriter: usar partitionOverwriteMode dinâmico ou liquid clustering com INSERT INTO&amp;hellip;REPLACE USING pra substituir só o subconjunto de dados afetado, sem tocar no resto da tabela.</description>
    </item>
    <item>
      <title>Delta 4.3 faz até CREATE TABLE passar pelo catálogo, não só a leitura</title>
      <link>https://wiliamrosa.github.io/posts/delta-lake-4-3-catalog-managed-tables/</link>
      <pubDate>Tue, 23 Jun 2026 09:00:00 -0300</pubDate>
      <guid>https://wiliamrosa.github.io/posts/delta-lake-4-3-catalog-managed-tables/</guid>
      <description>Delta 4.3 expande as catalog-managed tables para que operações de escrita, CREATE, REPLACE, ALTER TABLE, também passem por validação de commit do lado do catálogo, não só a leitura.</description>
    </item>
    <item>
      <title>Quando o Unity Catalog vira coordenador de transação, não só o dicionário de tabelas</title>
      <link>https://wiliamrosa.github.io/articles/databricks-catalog-commits-unity-catalog-transacoes/</link>
      <pubDate>Sat, 06 Jun 2026 09:00:00 -0300</pubDate>
      <guid>https://wiliamrosa.github.io/articles/databricks-catalog-commits-unity-catalog-transacoes/</guid>
      <description>Catalog Commits tira a coordenação de transação do Delta Lake do object storage e coloca dentro do Unity Catalog, habilitando transação atômica entre várias tabelas e leitura de metadado sem round-trip pra nuvem. O recurso central já é GA desde maio de 2026, com Delta Spark, Flink, Trino e DuckDB entre os engines suportados, mas escrita de engine externo continua em Beta e tabela Iceberg gerenciada em Private Preview.</description>
    </item>
    <item>
      <title>Nem tudo precisa da mesma granularidade: como separar SLA por fluxo derrubou custo de dado em 50x</title>
      <link>https://wiliamrosa.github.io/articles/octopus-energy-arquitetura-multi-grain-custo-dados/</link>
      <pubDate>Sun, 24 May 2026 09:00:00 -0300</pubDate>
      <guid>https://wiliamrosa.github.io/articles/octopus-energy-arquitetura-multi-grain-custo-dados/</guid>
      <description>A Octopus Energy reduziu de 25 bilhões pra 300 milhões de linhas processadas trocando um pipeline mensal monolítico por três fluxos independentes de granularidade diferente, usando Change Data Feed, dbt incremental e Adaptive Query Execution. O custo por dado de liquidação MHHS caiu de cerca de 23 dólares pra menos de 50 centavos.</description>
    </item>
    <item>
      <title>Streaming não é sobre velocidade máxima, é sobre acertar o relógio certo pra cada dado</title>
      <link>https://wiliamrosa.github.io/articles/streaming-right-time-processing-databricks/</link>
      <pubDate>Fri, 10 Nov 2023 09:00:00 -0300</pubDate>
      <guid>https://wiliamrosa.github.io/articles/streaming-right-time-processing-databricks/</guid>
      <description>A divisão rígida entre pipeline batch e pipeline streaming é mais uma escolha de ferramenta antiga do que uma necessidade real: Spark Structured Streaming trata os dois casos como pontos no mesmo espectro de latência, com o mesmo motor, o mesmo código e as mesmas garantias de tolerância a falha.</description>
    </item>
  </channel>
</rss>
