Lakeflow Jobs ganhou trigger contínuo pra job de streaming parar de depender de gambiarra de CRON

O trigger continuous transforma um Lakeflow Job em serviço always-on que reinicia sozinho assim que termina ou falha, delegando pra Databricks a responsabilidade de manter o job rodando sem interrupção, em vez de forçar CRON ou trigger orientado a evento a fazer papel de scheduler contínuo.

setembro 13, 2026 · 2 min · 304 words · Wiliam Rosa

Zerobus Ingest ganhou protocolo binário Arrow Flight como terceiro formato de envio

Apache Arrow Flight chegou como formato de envio pro Zerobus Ingest do Lakeflow Connect, ao lado de JSON e protobuf, carregando RecordBatch colunar direto pela mesma conexão gRPC, com SDK em Python e Rust e opção de compressão ZSTD ou LZ4.

setembro 2, 2026 · 2 min · 349 words · Wiliam Rosa

Detectar dado corrompido em menos de 1 milissegundo: o que muda quando o Spark para de esperar o próximo micro-batch

O Apache Spark Real-Time Mode processa evento por evento em vez de esperar o próximo micro-batch fechar, e um experimento publicado pela Databricks usando transações da blockchain Ethereum mostrou latência p99 abaixo de 1 milissegundo classificando dado como válido ou suspeito em tempo real.

julho 14, 2026 · 6 min · 1091 words · Wiliam Rosa

1 petabyte em menos de 24 horas: o que acontece quando você tira a partição fixa do meio do caminho

A Databricks publicou um teste de carga do Zerobus Ingest usando o dataset NASA NEOWISE, sustentando 12 milhões de linhas por segundo e ingerindo mais de 1 trilhão de registros em 24 horas. O truque estrutural é deslocar a garantia de ordenação da partição fixa para a conexão de stream, permitindo autoscaling real de pods sem repensar o esquema de particionamento.

junho 12, 2026 · 6 min · 1083 words · Wiliam Rosa

Sessionizar milhões de jogadores sem reprocessar nada: o que muda com timer nativo no Structured Streaming

Uma plataforma de gaming usou o Apache Spark Real-Time Mode com transformWithState pra sessionizar 4 milhões de sessões simultâneas com latência p99 de 432 milissegundos, cerca de 20x mais rápido que o mesmo pipeline em micro-batch. O ganho central vem de timers nativos que produzem saída mesmo sem novo evento chegar.

junho 4, 2026 · 5 min · 1061 words · Wiliam Rosa