<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/">
  <channel>
    <title>Articles on Wiliam Rosa | Lakehouse, Dados &amp; IA</title>
    <link>https://wiliamrosa.github.io/articles/</link>
    <description>Recent content in Articles on Wiliam Rosa | Lakehouse, Dados &amp; IA</description>
    <image>
      <title>Wiliam Rosa | Lakehouse, Dados &amp; IA</title>
      <url>https://wiliamrosa.github.io/images/wiliam-rosa-blog-og.png</url>
      <link>https://wiliamrosa.github.io/images/wiliam-rosa-blog-og.png</link>
    </image>
    <generator>Hugo</generator>
    <language>pt-br</language>
    <lastBuildDate>Thu, 10 Sep 2026 15:00:00 -0300</lastBuildDate>
    <atom:link href="https://wiliamrosa.github.io/articles/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>A lacuna entre aplicações e analytics, e como o Lakebase a resolve</title>
      <link>https://wiliamrosa.github.io/articles/lakebase-lacuna-aplicacoes-analytics/</link>
      <pubDate>Thu, 10 Sep 2026 15:00:00 -0300</pubDate>
      <guid>https://wiliamrosa.github.io/articles/lakebase-lacuna-aplicacoes-analytics/</guid>
      <description>Lakebase é um Postgres totalmente gerenciado e nativo da Databricks Data Intelligence Platform, pensado pra unificar workload transacional e analítico com governança única via Unity Catalog, sincronização bidirecional e recursos como autoscaling, scale-to-zero e database branching.</description>
    </item>
    <item>
      <title>Avaliação não é etapa final: o loop duplo que decide se um agente de IA vai pra produção</title>
      <link>https://wiliamrosa.github.io/articles/mlflow-avaliacao-loop-duplo-agentes-producao/</link>
      <pubDate>Thu, 10 Sep 2026 09:00:00 -0300</pubDate>
      <guid>https://wiliamrosa.github.io/articles/mlflow-avaliacao-loop-duplo-agentes-producao/</guid>
      <description>O case da Zepto usando MLflow mostra um padrão generalizável, dois loops separados, um de desenvolvimento e um de produção, ligados por um portão de qualidade, mais dataset dourado que cresce com o tempo e amostragem estratificada por risco em vez de amostragem uniforme. É engenharia de avaliação, não só uma métrica de acurácia isolada.</description>
    </item>
    <item>
      <title>Control tower, não relatório: orquestrando Solvency II sem sair do lakehouse</title>
      <link>https://wiliamrosa.github.io/articles/databricks-solvency-ii-control-tower-relatorio-regulatorio/</link>
      <pubDate>Thu, 10 Sep 2026 09:00:00 -0300</pubDate>
      <guid>https://wiliamrosa.github.io/articles/databricks-solvency-ii-control-tower-relatorio-regulatorio/</guid>
      <description>Solvency II não é um relatório, é uma cadeia de ingestão, validação, modelagem atuarial e aprovação que hoje vive espalhada entre planilha, motor atuarial e ferramenta de BI isolada. A Databricks propõe um control tower único sobre o lakehouse, com trilha de auditoria nativa e agente de IA revisando reconciliação de QRT, mas isso não elimina a dependência do motor atuarial legado.</description>
    </item>
    <item>
      <title>Por que o cache padrão do Postgres não funciona dentro de um banco desagregado</title>
      <link>https://wiliamrosa.github.io/articles/lakebase-postgres-cache-huge-pages-shared-buffers/</link>
      <pubDate>Thu, 10 Sep 2026 09:00:00 -0300</pubDate>
      <guid>https://wiliamrosa.github.io/articles/lakebase-postgres-cache-huge-pages-shared-buffers/</guid>
      <description>O Lakebase separa compute de storage, e isso quebra a lógica de cache que o Postgres tradicional assume há décadas. A Databricks detalhou como resolveu isso combinando um cache local autoscaling, shared buffers maiores em compute fixo e huge pages na stack inteira, com ganhos de até 5x em leitura de storage.</description>
    </item>
    <item>
      <title>Agente que sobrevive à queda de worker: durabilidade real combinando Temporal e Lakebase</title>
      <link>https://wiliamrosa.github.io/articles/agentes-duraveis-temporal-lakebase-postgres/</link>
      <pubDate>Wed, 09 Sep 2026 09:00:00 -0300</pubDate>
      <guid>https://wiliamrosa.github.io/articles/agentes-duraveis-temporal-lakebase-postgres/</guid>
      <description>Agente de IA de longa duração falha de um jeito diferente de API request-response: o processo pode cair no meio de uma etapa que já produziu efeito parcial. Um projeto de referência combina Temporal para reexecução determinística de workflow com Lakebase Postgres para estado operacional consultável, mas a idempotência de cada passo continua sendo responsabilidade de quem escreve o código do agente.</description>
    </item>
    <item>
      <title>Antes de abrir o Grafana: como a Databricks usa agente de IA pra investigar o próprio incidente</title>
      <link>https://wiliamrosa.github.io/articles/databricks-ai-sre-investigacao-incidentes-agente/</link>
      <pubDate>Tue, 25 Aug 2026 09:00:00 -0300</pubDate>
      <guid>https://wiliamrosa.github.io/articles/databricks-ai-sre-investigacao-incidentes-agente/</guid>
      <description>A Databricks documentou o AI SRE, agente interno que roda checagem de plataforma, análise de log e runbook de time em paralelo assim que um incidente dispara, entregando causa raiz com evidência rastreável antes de um engenheiro terminar de montar o contexto manualmente.</description>
    </item>
    <item>
      <title>Quando a chamada síncrona vira gargalo em escala de dezenas de milhões de VMs por dia</title>
      <link>https://wiliamrosa.github.io/articles/arquitetura-event-driven-configuracao-rede-serverless/</link>
      <pubDate>Thu, 13 Aug 2026 09:00:00 -0300</pubDate>
      <guid>https://wiliamrosa.github.io/articles/arquitetura-event-driven-configuracao-rede-serverless/</guid>
      <description>A Databricks trocou um caminho de configuração de rede baseado em chamadas síncronas a múltiplos serviços por um pipeline assíncrono orientado a eventos, separando o caminho de gerenciamento do caminho de atendimento crítico. O resultado publicado: latência p99 caindo de cerca de 5 segundos pra 125 milissegundos e disponibilidade subindo de 99,8% para 99,99%.</description>
    </item>
    <item>
      <title>Cinco alavancas técnicas pra baixar o custo de coding agent sem cortar acesso do time</title>
      <link>https://wiliamrosa.github.io/articles/databricks-reducao-custo-coding-agents-roteamento-modelos/</link>
      <pubDate>Sat, 08 Aug 2026 09:00:00 -0300</pubDate>
      <guid>https://wiliamrosa.github.io/articles/databricks-reducao-custo-coding-agents-roteamento-modelos/</guid>
      <description>Orçamento é só uma parte da conta de coding agent em escala. A Databricks lista cinco alavancas técnicas, roteamento dinâmico por modelo mais barato, meta-harness pra trocar de modelo sem fricção, e redução de token via cache e compressão de contexto, que reduziram custo em até 50% sem baixar qualidade percebida pelo engenheiro.</description>
    </item>
    <item>
      <title>Por que um agente que já conhece seu catálogo vence um agente de código genérico em tarefa de dado</title>
      <link>https://wiliamrosa.github.io/articles/genie-code-agente-dados-vs-agente-codigo-generico/</link>
      <pubDate>Fri, 24 Jul 2026 09:00:00 -0300</pubDate>
      <guid>https://wiliamrosa.github.io/articles/genie-code-agente-dados-vs-agente-codigo-generico/</guid>
      <description>Um benchmark interno da Databricks com 401 tarefas reais de descoberta de dado mostra o Genie Code batendo agentes de código genéricos em acurácia e custo, e a explicação não é o modelo por trás, é o agente não precisar explorar o workspace às cegas.</description>
    </item>
    <item>
      <title>Índice de texto no Delta Lake: o que muda quando o Databricks para de escanear tudo pra achar uma palavra</title>
      <link>https://wiliamrosa.github.io/articles/databricks-indice-busca-textual-delta-lake/</link>
      <pubDate>Sat, 18 Jul 2026 09:00:00 -0300</pubDate>
      <guid>https://wiliamrosa.github.io/articles/databricks-indice-busca-textual-delta-lake/</guid>
      <description>O índice de busca textual do Unity Catalog (Beta na Databricks Runtime 18.2) deixa de varrer arquivo por arquivo atrás de uma palavra e passa a pular direto pra onde ela realmente está. O ganho de performance é real, mas vem com manutenção manual e uma lista de recursos incompatíveis que vale conhecer antes de sair criando índice em tudo.</description>
    </item>
    <item>
      <title>Detectar dado corrompido em menos de 1 milissegundo: o que muda quando o Spark para de esperar o próximo micro-batch</title>
      <link>https://wiliamrosa.github.io/articles/spark-real-time-mode-deteccao-anomalias-blockchain/</link>
      <pubDate>Tue, 14 Jul 2026 09:00:00 -0300</pubDate>
      <guid>https://wiliamrosa.github.io/articles/spark-real-time-mode-deteccao-anomalias-blockchain/</guid>
      <description>O Apache Spark Real-Time Mode processa evento por evento em vez de esperar o próximo micro-batch fechar, e um experimento publicado pela Databricks usando transações da blockchain Ethereum mostrou latência p99 abaixo de 1 milissegundo classificando dado como válido ou suspeito em tempo real.</description>
    </item>
    <item>
      <title>Runtime engessado ou imagem Docker própria: o dilema de compliance que o Databricks Container Services resolve</title>
      <link>https://wiliamrosa.github.io/articles/databricks-container-services-docker-compliance/</link>
      <pubDate>Fri, 26 Jun 2026 09:00:00 -0300</pubDate>
      <guid>https://wiliamrosa.github.io/articles/databricks-container-services-docker-compliance/</guid>
      <description>Databricks Container Services deixa trocar o runtime gerenciado por uma imagem Docker própria, construída e escaneada no seu próprio pipeline de CI/CD. Resolve certificado corporativo, biblioteca proibida e ambiente travado, mas exige abrir mão de parte do conforto de um cluster totalmente gerenciado.</description>
    </item>
    <item>
      <title>Clean Rooms empacotados: como rodar o algoritmo de um parceiro sem nunca ver o código dele</title>
      <link>https://wiliamrosa.github.io/articles/clean-rooms-empacotados-provedor-consumidor/</link>
      <pubDate>Fri, 19 Jun 2026 09:00:00 -0300</pubDate>
      <guid>https://wiliamrosa.github.io/articles/clean-rooms-empacotados-provedor-consumidor/</guid>
      <description>O modo &amp;rsquo;empacotado&amp;rsquo; das Clean Rooms do Azure Databricks separa o papel de provedor (que traz o algoritmo e nunca expõe o código) do papel de consumidor (que traz o dado e nunca vê a lógica), permitindo cruzar identidade ou fazer matching entre empresas sem que nenhum dos dois lados abra mão do que é proprietário.</description>
    </item>
    <item>
      <title>1 petabyte em menos de 24 horas: o que acontece quando você tira a partição fixa do meio do caminho</title>
      <link>https://wiliamrosa.github.io/articles/zerobus-ingest-particionamento-dinamico-petabyte/</link>
      <pubDate>Fri, 12 Jun 2026 09:00:00 -0300</pubDate>
      <guid>https://wiliamrosa.github.io/articles/zerobus-ingest-particionamento-dinamico-petabyte/</guid>
      <description>A Databricks publicou um teste de carga do Zerobus Ingest usando o dataset NASA NEOWISE, sustentando 12 milhões de linhas por segundo e ingerindo mais de 1 trilhão de registros em 24 horas. O truque estrutural é deslocar a garantia de ordenação da partição fixa para a conexão de stream, permitindo autoscaling real de pods sem repensar o esquema de particionamento.</description>
    </item>
    <item>
      <title>Quando o Unity Catalog vira coordenador de transação, não só o dicionário de tabelas</title>
      <link>https://wiliamrosa.github.io/articles/databricks-catalog-commits-unity-catalog-transacoes/</link>
      <pubDate>Sat, 06 Jun 2026 09:00:00 -0300</pubDate>
      <guid>https://wiliamrosa.github.io/articles/databricks-catalog-commits-unity-catalog-transacoes/</guid>
      <description>Catalog Commits tira a coordenação de transação do Delta Lake do object storage e coloca dentro do Unity Catalog, habilitando transação atômica entre várias tabelas e leitura de metadado sem round-trip pra nuvem. O recurso central já é GA desde maio de 2026, com Delta Spark, Flink, Trino e DuckDB entre os engines suportados, mas escrita de engine externo continua em Beta e tabela Iceberg gerenciada em Private Preview.</description>
    </item>
    <item>
      <title>Sessionizar milhões de jogadores sem reprocessar nada: o que muda com timer nativo no Structured Streaming</title>
      <link>https://wiliamrosa.github.io/articles/real-time-mode-sessionizacao-gaming-transformwithstate/</link>
      <pubDate>Thu, 04 Jun 2026 09:00:00 -0300</pubDate>
      <guid>https://wiliamrosa.github.io/articles/real-time-mode-sessionizacao-gaming-transformwithstate/</guid>
      <description>Uma plataforma de gaming usou o Apache Spark Real-Time Mode com transformWithState pra sessionizar 4 milhões de sessões simultâneas com latência p99 de 432 milissegundos, cerca de 20x mais rápido que o mesmo pipeline em micro-batch. O ganho central vem de timers nativos que produzem saída mesmo sem novo evento chegar.</description>
    </item>
    <item>
      <title>Nem tudo precisa da mesma granularidade: como separar SLA por fluxo derrubou custo de dado em 50x</title>
      <link>https://wiliamrosa.github.io/articles/octopus-energy-arquitetura-multi-grain-custo-dados/</link>
      <pubDate>Sun, 24 May 2026 09:00:00 -0300</pubDate>
      <guid>https://wiliamrosa.github.io/articles/octopus-energy-arquitetura-multi-grain-custo-dados/</guid>
      <description>A Octopus Energy reduziu de 25 bilhões pra 300 milhões de linhas processadas trocando um pipeline mensal monolítico por três fluxos independentes de granularidade diferente, usando Change Data Feed, dbt incremental e Adaptive Query Execution. O custo por dado de liquidação MHHS caiu de cerca de 23 dólares pra menos de 50 centavos.</description>
    </item>
    <item>
      <title>dbt dentro do Lakeflow: o que muda quando o orquestrador para de ser um sistema à parte</title>
      <link>https://wiliamrosa.github.io/articles/dbt-databricks-lakehouse-aberto-orquestracao/</link>
      <pubDate>Fri, 17 Apr 2026 09:00:00 -0300</pubDate>
      <guid>https://wiliamrosa.github.io/articles/dbt-databricks-lakehouse-aberto-orquestracao/</guid>
      <description>Tratar dbt como tipo de tarefa nativo do Lakeflow Jobs, em vez de um orquestrador externo apontando pra um warehouse, unifica visibilidade de falha, governança via Unity Catalog e performance de Photon numa única stack, mas ainda exige repositório Git e SQL warehouse serverless ou pro como pré-requisito.</description>
    </item>
    <item>
      <title>De PDF solto a coluna de tabela: o pipeline que domestica documento não estruturado no lakehouse</title>
      <link>https://wiliamrosa.github.io/articles/databricks-document-intelligence-pipeline-documentos-nao-estruturados/</link>
      <pubDate>Fri, 17 Apr 2026 09:00:00 -0300</pubDate>
      <guid>https://wiliamrosa.github.io/articles/databricks-document-intelligence-pipeline-documentos-nao-estruturados/</guid>
      <description>ai_parse_document, ai_extract e ai_classify já são GA no Azure Databricks, e o pipeline de processamento inteligente de documento (IDP) inteiro roda dentro do Lakeflow, sem infraestrutura separada de OCR ou fila de mensagem. A peça que ainda é Beta, ai_prep_search, é justamente a que decide se o documento processado vira retrieval bom ou lixo semântico.</description>
    </item>
    <item>
      <title>Lakeflow no Azure Databricks: quando ingestão, transformação e orquestração param de ser três produtos separados</title>
      <link>https://wiliamrosa.github.io/articles/lakeflow-azure-modernizacao-engenharia-dados/</link>
      <pubDate>Wed, 11 Feb 2026 09:00:00 -0300</pubDate>
      <guid>https://wiliamrosa.github.io/articles/lakeflow-azure-modernizacao-engenharia-dados/</guid>
      <description>Lakeflow consolida Connect, Spark Declarative Pipelines e Jobs numa única superfície de engenharia de dados dentro do Azure Databricks, substituindo a combinação típica de ferramenta de ingestão, orquestrador externo e scripts de transformação por um único plano de controle governado pelo Unity Catalog.</description>
    </item>
    <item>
      <title>Por que juntar SIEM e lakehouse na mesma tabela muda o cálculo de custo e velocidade em SecOps</title>
      <link>https://wiliamrosa.github.io/articles/databricks-lakehouse-nativo-ciberseguranca/</link>
      <pubDate>Wed, 01 Oct 2025 09:00:00 -0300</pubDate>
      <guid>https://wiliamrosa.github.io/articles/databricks-lakehouse-nativo-ciberseguranca/</guid>
      <description>Data Intelligence for Cybersecurity une Agent Bricks, Lakebase e o padrão aberto OCSF sobre Delta Lake pra tratar telemetria de segurança como dado de lakehouse governado, em vez de um silo isolado dentro de um SIEM proprietário caro por volume ingerido.</description>
    </item>
    <item>
      <title>Como ensinar um LLM a passar no teste de Spark SQL sem decorar a prova</title>
      <link>https://wiliamrosa.github.io/articles/geracao-testes-codigo-llm-spark-sql/</link>
      <pubDate>Thu, 03 Oct 2024 09:00:00 -0300</pubDate>
      <guid>https://wiliamrosa.github.io/articles/geracao-testes-codigo-llm-spark-sql/</guid>
      <description>Avaliar modelo de código em biblioteca de nicho como Spark SQL esbarra num problema básico: falta benchmark bom. Um pipeline de quatro estágios da Databricks gera caso de teste automaticamente a partir da própria função, com validação cruzada entre dois modelos, e revela que instrução simples como comentário de notebook do Azure Databricks muda o resultado do modelo de forma mensurável.</description>
    </item>
    <item>
      <title>Streaming não é sobre velocidade máxima, é sobre acertar o relógio certo pra cada dado</title>
      <link>https://wiliamrosa.github.io/articles/streaming-right-time-processing-databricks/</link>
      <pubDate>Fri, 10 Nov 2023 09:00:00 -0300</pubDate>
      <guid>https://wiliamrosa.github.io/articles/streaming-right-time-processing-databricks/</guid>
      <description>A divisão rígida entre pipeline batch e pipeline streaming é mais uma escolha de ferramenta antiga do que uma necessidade real: Spark Structured Streaming trata os dois casos como pontos no mesmo espectro de latência, com o mesmo motor, o mesmo código e as mesmas garantias de tolerância a falha.</description>
    </item>
    <item>
      <title>Gestão de custo no Databricks é decisão de política de cluster, não corte de orçamento no fim do mês</title>
      <link>https://wiliamrosa.github.io/articles/gestao-custo-databricks-politicas-cluster/</link>
      <pubDate>Wed, 19 Oct 2022 09:00:00 -0300</pubDate>
      <guid>https://wiliamrosa.github.io/articles/gestao-custo-databricks-politicas-cluster/</guid>
      <description>Controlar gasto no Databricks funciona melhor como restrição estrutural definida em cluster policy, autoscaling e auto-termination, do que como auditoria reativa de fatura no fim do mês. O trade-off central é entre restringir demais e travar produtividade, ou liberar demais e perder controle de custo.</description>
    </item>
  </channel>
</rss>
