Kafka 深入解析
Kafka 深入解析是开发者需要掌握的知识点。本文从基础概念开始结合实际案例详细讲解帮助读者深入理解并应用到实际开发中。
Kafka 入门教程
Kafka 入门教程是开发者需要掌握的知识点。本文从基础概念开始结合实际案例详细讲解帮助读者深入理解并应用到实际开发中。
Kafka 核心概念
Kafka 核心概念是开发者需要掌握的知识点。本文从基础概念开始结合实际案例详细讲解帮助读者深入理解并应用到实际开发中。
Kafka 配置方法
Kafka 配置方法是开发者需要掌握的知识点。本文从基础概念开始结合实际案例详细讲解帮助读者深入理解并应用到实际开发中。
Kafka 最佳实践
Kafka 最佳实践是开发者需要掌握的知识点。本文从基础概念开始结合实际案例详细讲解帮助读者深入理解并应用到实际开发中。
Kafka 实战指南
Kafka 实战指南是开发者需要掌握的知识点。本文从基础概念开始结合实际案例详细讲解帮助读者深入理解并应用到实际开发中。
Apache Calcite SQL 优化器
Apache Calcite 是 SQL 查询优化框架解析 SQL 生成执行计划。成本模型选择最优路径。多种数据库方言支持。本文解析 SQL 并查看执行计划。
Apache Hadoop HDFS 架构
HDFS 是分布式文件系统 NameNode 管理元数据 DataNode 存储数据块。默认三副本保证可靠性。Block 128MB。本文解释 HDFS 读写数据的过程。
Flink Savepoint 状态恢复
Flink Savepoint 状态恢复是开发中常用的技术工具或方法。本文从实际应用出发介绍核心概念和操作步骤帮助读者快速上手并掌握关键技巧。
Apache Kafka 幂等生产者
Kafka 幂等生产者防止网络重试导致的重复消息。enable.idempotence=true。事务 API 跨分区原子写入。本文配置 Exactly-Once 语义生产者。
Dask 分布式 DataFrame
Dask Distributed 调度器在多节点上并行执行任务。Client 连接集群。分布式 DataFrame 处理 TB 级数据。本文部署 Dask 集群进行大规模数据聚合。
Apache Spark Structured Streaming
Spark Structured Streaming 用 DataFrame 做流处理支持事件时间和 Watermark。微批处理默认连续处理可选。适合实时 ETL 和监控。本文用 Spark 实时计算 PV。
Apache Kafka Compact Topic
Kafka Compact Topic 保留每个 key 的最新消息适合存储数据库的变更日志或状态快照。Log Cleaner 后台压缩删除旧记录。本文配置 KTable 的 compact 策略。
InfluxDB 连续查询和保留策略
InfluxDB 连续查询自动预聚合降采样长期数据保留策略自动过期删除旧数据。节省存储空间加快历史查询。本文配置连续查询每分钟聚合平均 CPU 温度。
Apache Nifi 数据流自动化
Nifi 拖拽处理器构建数据流自动化。ProcessGroup 组织流程。数据溯源追踪每条记录的流转。适合数据管道和实时集成。本文创建一个从 FTP 传输数据到 S3 的流程。
InfluxDB 2.0 Flux 查询语言
InfluxDB 2.0 用 Flux 函数式查询语言代替 InfluxQL。管道前向处理时序数据。from range filter 三步查询标准模式。本文用 Flux 计算 CPU 平均使用率。
Flink Watermark 事件时间处理
Flink Watermark 标记事件时间的进度到达窗口触发时间。乱序数据等待 Watermark 后才触发。allowedLateness 控制迟到。本文配置 Flink 处理延迟数据。
Debezium 实时数据同步
Debezium 基于 Kafka Connect 实时捕获数据库变更输出为事件流。支持 MySQL/PostgreSQL/MongoDB。Avro 序列化保持 schema。本文用 Debezium 同步 MySQL 到 ES。
Greenplum 到 Snowflake 数仓迁移
从本地 Greenplum 迁移到云数仓 Snowflake 涉及数据类型转换和并行导出。外部表暂存数据。本文规划迁移的检查清单和执行步骤。
Apache Beam 统一批流处理
Beam 统一批流处理编程模型管道一次编写多 Runner 运行(Flink/Spark/Dataflow)。适合 ETL 和数据管道。本文写一个 Beam 管道同时处理批和流数据。
Flink CDC 实时捕获数据库变更
Flink CDC 基于 Debezium 实时捕获数据库的 INSERT/UPDATE/DELETE。支持 MySQL/PostgreSQL/MongoDB。实时同步到数据湖或消息队列。本文用 Flink CDC 同步 MySQL 到 Kafka。
Apache Iceberg 表格式数据湖
Iceberg 是开放表格式支持 ACID 事务和快照查询。分区演化不重写数据。兼容 Spark/Flink/Trino。本文对比 Iceberg 和 Hive 表的性能差异。
Dask 并行计算替代 Pandas
Dask 兼容 Pandas API 惰性求值构建任务图。分布式调度跨集群。处理超内存数据。本文用 Dask 处理 GB 级 CSV。
Greenplum MPP 分析数据库
Greenplum 是 MPP 分析数据库数据分布式到 Segment 并行查询。适合 PB 级数据仓库。本文对比 Greenplum 和 ClickHouse。
ClickHouse 列式存储的查询性能优势
ClickHouse 是列式 OLAP 数据库列存只读取需要的列压缩率高。向量化执行引擎充分利用 CPU。物化视图加速预聚合查询。本文用 10 亿行日志数据对比 ClickHouse 和 MySQL。
Airflow 工作流调度平台
Airflow 用 Python 代码定义 DAG 工作流。任务间的依赖关系自动决定执行顺序。调度器周期性触发。本文写一个定时执行 ETL 任务的 DAG。
Kafka Streams 流处理 DSL
Kafka Streams 是轻量的流处理库嵌入应用运行不需要独立集群。DSL 提供 map/filter/groupBy 操作。本文用实时订单统计展示 Kafka Streams 的用法。
Presto/Trino SQL 查询多数据源
Trino 用 SQL 查询跨多个数据源的数据包括 MySQLPostgreSQLKafka 和 Hive。不需要迁移数据。本文用 Trino 同时查询关系数据库和对象存储。
Spark RDD DataFrame DataSet 的区别
Spark 的 RDD 是底层数据抽象DataFrame 有 schema 优化更好DataSets 结合了类型安全和 DataFrames 的性能。Catalyst 优化器对 DataFrame 做查询优化。
Flink 流处理的基本概念
Flink 是分布式流处理引擎支持事件时间和处理时间。Window 按时间或数量聚合。Checkpoint 保证 Exactly-Once 语义。本文用实时计算用户点击量展示 Flink 的用法。
时间序列数据库 InfluxDB 入门
InfluxDB 是为时序数据优化的数据库写入快查询针对时间范围做了优化。适合监控指标和 IoT 数据存储。本文介绍 InfluxDB 的基本概念和常用查询。
Elasticsearch 全文搜索的倒排索引原理
Elasticsearch 的搜索速度来自倒排索引结构将文档中的词映射到文档列表而不是遍历所有文档。分词器把文本拆成词条。本文解释倒排索引的结构和搜索过程。
PySpark 数据处理
通过 PySpark 编写 Python 代码运行在 Spark 集群上,进行大规模 ETL 和分析。
Hadoop 生态系统基础与实操
理解 Hadoop 分布式文件系统与 MapReduce 计算模型,搭建本地集群并运行经典的单词计数作业,奠定大数据基础。
Apache Spark 大数据处理快速入门
使用 PySpark 编写分布式数据处理程序,学习 Spark DataFrame 操作、SQL 查询和常见性能优化,处理 TB 级数据集。
Elasticsearch 全文搜索与数据分析
深入 Elasticsearch 搜索原理,掌握映射设计、DSL 查询、聚合分析及性能调优,搭建企业级搜索与日志分析平台。
Apache Kafka 流处理平台实战
学习 Kafka 架构、主题分区、消费者组再均衡以及 Kafka Streams DSL,构建可靠的实时数据管道和事件驱动应用。