免费编程教程

Kafka 深入解析

Kafka 深入解析是开发者需要掌握的知识点。本文从基础概念开始结合实际案例详细讲解帮助读者深入理解并应用到实际开发中。

14 0 0
2026-07-15
Kafka 入门教程

Kafka 入门教程是开发者需要掌握的知识点。本文从基础概念开始结合实际案例详细讲解帮助读者深入理解并应用到实际开发中。

12 0 0
2026-07-15
Kafka 核心概念

Kafka 核心概念是开发者需要掌握的知识点。本文从基础概念开始结合实际案例详细讲解帮助读者深入理解并应用到实际开发中。

9 0 0
2026-07-15
Kafka 配置方法

Kafka 配置方法是开发者需要掌握的知识点。本文从基础概念开始结合实际案例详细讲解帮助读者深入理解并应用到实际开发中。

12 0 0
2026-07-15
Kafka 最佳实践

Kafka 最佳实践是开发者需要掌握的知识点。本文从基础概念开始结合实际案例详细讲解帮助读者深入理解并应用到实际开发中。

13 0 0
2026-07-14
Kafka 实战指南

Kafka 实战指南是开发者需要掌握的知识点。本文从基础概念开始结合实际案例详细讲解帮助读者深入理解并应用到实际开发中。

16 0 0
2026-07-14
Apache Calcite SQL 优化器

Apache Calcite 是 SQL 查询优化框架解析 SQL 生成执行计划。成本模型选择最优路径。多种数据库方言支持。本文解析 SQL 并查看执行计划。

12 0 0
2026-07-13
Apache Hadoop HDFS 架构

HDFS 是分布式文件系统 NameNode 管理元数据 DataNode 存储数据块。默认三副本保证可靠性。Block 128MB。本文解释 HDFS 读写数据的过程。

14 0 0
2026-07-13
Flink Savepoint 状态恢复

Flink Savepoint 状态恢复是开发中常用的技术工具或方法。本文从实际应用出发介绍核心概念和操作步骤帮助读者快速上手并掌握关键技巧。

12 0 0
2026-07-13
Apache Kafka 幂等生产者

Kafka 幂等生产者防止网络重试导致的重复消息。enable.idempotence=true。事务 API 跨分区原子写入。本文配置 Exactly-Once 语义生产者。

13 0 0
2026-07-12
Dask 分布式 DataFrame

Dask Distributed 调度器在多节点上并行执行任务。Client 连接集群。分布式 DataFrame 处理 TB 级数据。本文部署 Dask 集群进行大规模数据聚合。

16 0 0
2026-07-12
Apache Spark Structured Streaming

Spark Structured Streaming 用 DataFrame 做流处理支持事件时间和 Watermark。微批处理默认连续处理可选。适合实时 ETL 和监控。本文用 Spark 实时计算 PV。

18 0 0
2026-07-12
Apache Kafka Compact Topic

Kafka Compact Topic 保留每个 key 的最新消息适合存储数据库的变更日志或状态快照。Log Cleaner 后台压缩删除旧记录。本文配置 KTable 的 compact 策略。

12 0 0
2026-07-12
InfluxDB 连续查询和保留策略

InfluxDB 连续查询自动预聚合降采样长期数据保留策略自动过期删除旧数据。节省存储空间加快历史查询。本文配置连续查询每分钟聚合平均 CPU 温度。

21 0 0
2026-07-12
Apache Nifi 数据流自动化

Nifi 拖拽处理器构建数据流自动化。ProcessGroup 组织流程。数据溯源追踪每条记录的流转。适合数据管道和实时集成。本文创建一个从 FTP 传输数据到 S3 的流程。

8 0 0
2026-07-11
InfluxDB 2.0 Flux 查询语言

InfluxDB 2.0 用 Flux 函数式查询语言代替 InfluxQL。管道前向处理时序数据。from range filter 三步查询标准模式。本文用 Flux 计算 CPU 平均使用率。

26 0 0
2026-07-11
Flink Watermark 事件时间处理

Flink Watermark 标记事件时间的进度到达窗口触发时间。乱序数据等待 Watermark 后才触发。allowedLateness 控制迟到。本文配置 Flink 处理延迟数据。

14 0 0
2026-07-11
Debezium 实时数据同步

Debezium 基于 Kafka Connect 实时捕获数据库变更输出为事件流。支持 MySQL/PostgreSQL/MongoDB。Avro 序列化保持 schema。本文用 Debezium 同步 MySQL 到 ES。

22 0 0
2026-07-10
Greenplum 到 Snowflake 数仓迁移

从本地 Greenplum 迁移到云数仓 Snowflake 涉及数据类型转换和并行导出。外部表暂存数据。本文规划迁移的检查清单和执行步骤。

12 0 0
2026-07-10
Apache Beam 统一批流处理

Beam 统一批流处理编程模型管道一次编写多 Runner 运行(Flink/Spark/Dataflow)。适合 ETL 和数据管道。本文写一个 Beam 管道同时处理批和流数据。

14 0 0
2026-07-10
Flink CDC 实时捕获数据库变更

Flink CDC 基于 Debezium 实时捕获数据库的 INSERT/UPDATE/DELETE。支持 MySQL/PostgreSQL/MongoDB。实时同步到数据湖或消息队列。本文用 Flink CDC 同步 MySQL 到 Kafka。

19 0 0
2026-07-10
Apache Iceberg 表格式数据湖

Iceberg 是开放表格式支持 ACID 事务和快照查询。分区演化不重写数据。兼容 Spark/Flink/Trino。本文对比 Iceberg 和 Hive 表的性能差异。

22 0 0
2026-07-10
Dask 并行计算替代 Pandas

Dask 兼容 Pandas API 惰性求值构建任务图。分布式调度跨集群。处理超内存数据。本文用 Dask 处理 GB 级 CSV。

16 0 0
2026-07-09
Greenplum MPP 分析数据库

Greenplum 是 MPP 分析数据库数据分布式到 Segment 并行查询。适合 PB 级数据仓库。本文对比 Greenplum 和 ClickHouse。

18 0 0
2026-07-09
ClickHouse 列式存储的查询性能优势

ClickHouse 是列式 OLAP 数据库列存只读取需要的列压缩率高。向量化执行引擎充分利用 CPU。物化视图加速预聚合查询。本文用 10 亿行日志数据对比 ClickHouse 和 MySQL。

11 0 0
2026-07-09
Airflow 工作流调度平台

Airflow 用 Python 代码定义 DAG 工作流。任务间的依赖关系自动决定执行顺序。调度器周期性触发。本文写一个定时执行 ETL 任务的 DAG。

15 0 0
2026-07-09
Kafka Streams 流处理 DSL

Kafka Streams 是轻量的流处理库嵌入应用运行不需要独立集群。DSL 提供 map/filter/groupBy 操作。本文用实时订单统计展示 Kafka Streams 的用法。

13 0 0
2026-07-09
Presto/Trino SQL 查询多数据源

Trino 用 SQL 查询跨多个数据源的数据包括 MySQLPostgreSQLKafka 和 Hive。不需要迁移数据。本文用 Trino 同时查询关系数据库和对象存储。

11 0 0
2026-07-09
Spark RDD DataFrame DataSet 的区别

Spark 的 RDD 是底层数据抽象DataFrame 有 schema 优化更好DataSets 结合了类型安全和 DataFrames 的性能。Catalyst 优化器对 DataFrame 做查询优化。

11 0 0
2026-07-09
Flink 流处理的基本概念

Flink 是分布式流处理引擎支持事件时间和处理时间。Window 按时间或数量聚合。Checkpoint 保证 Exactly-Once 语义。本文用实时计算用户点击量展示 Flink 的用法。

21 0 0
2026-07-08
时间序列数据库 InfluxDB 入门

InfluxDB 是为时序数据优化的数据库写入快查询针对时间范围做了优化。适合监控指标和 IoT 数据存储。本文介绍 InfluxDB 的基本概念和常用查询。

23 0 0
2026-07-08
Elasticsearch 全文搜索的倒排索引原理

Elasticsearch 的搜索速度来自倒排索引结构将文档中的词映射到文档列表而不是遍历所有文档。分词器把文本拆成词条。本文解释倒排索引的结构和搜索过程。

53 0 0
2026-07-08
GCP BigQuery

查询 PB 级数据无需管理服务器,利用 BigQuery ML 进行预测。

19 0 0
2026-06-30
大数据面试题

梳理数据倾斜、Shuffle 优化等高频考点,准备大数据工程师面试。

24 0 0
2026-06-18
ETL 设计与实现

设计高效的 ETL 管道,处理增量抽取、数据清洗和缓慢变化维。

18 0 0
2026-06-17
数据质量监控

使用 Great Expectations 等工具定义数据契约,检测数据漂移和异常。

24 0 0
2026-06-17
数据治理与血缘

建立数据资产目录,追踪数据流向,确保数据质量和合规使用。

20 0 0
2026-06-17
dbt 数据建模

使用 dbt 编写模块化 SQL 转换,测试数据质量并生成数据文档。

15 0 0
2026-06-17
Redshift 数据仓库

使用 Amazon Redshift 构建分析型数据库,通过分布和排序键优化查询。

20 0 0
2026-06-17
BigQuery 数据分析

利用 BigQuery 快速分析 PB 级数据,内置机器学习和地理空间函数。

29 0 0
2026-06-17
Snowflake 云数据仓库

使用 Snowflake 的存算分离架构,弹性伸缩并安全共享数据。

23 0 0
2026-06-17
Delta Lake 数据湖

在数据湖上实现 ACID 事务、可扩展的元数据处理和时间旅行查询。

39 0 0
2026-06-17
数据湖架构

设计基于对象存储的数据湖,利用多种计算引擎直接分析海量原始数据。

23 0 0
2026-06-17
Kafka Streams 实时计算

直接在 Kafka 上进行转换、聚合和连接操作,无需独立集群。

20 0 0
2026-06-17
Flink 流处理

使用 Apache Flink 进行实时流计算,处理事件时间、窗口和状态。

27 0 0
2026-06-17
Hive 数据仓库

使用 HiveQL 在 Hadoop 上进行类 SQL 查询,管理元数据和分区表。

22 0 0
2026-06-17
Hadoop 生态系统

了解 Hadoop 核心组件,搭建分布式文件系统和资源管理,运行批处理作业。

25 0 0
2026-06-17
PySpark 数据处理

通过 PySpark 编写 Python 代码运行在 Spark 集群上,进行大规模 ETL 和分析。

35 0 0
2026-06-17
Apache Spark 大数据

使用 PySpark 或 Scala Spark 处理大规模数据,掌握转换与动作算子。

18 0 0
2026-06-17
数据管道 Apache Airflow

使用 Airflow 创建、调度和监控复杂的数据工作流,管理依赖和重试。

24 0 0
2026-06-17
Apache Kafka 消息系统

掌握 Kafka 架构,学习生产者发布、消费者订阅和分区再均衡机制。

20 0 0
2026-06-16
数据湖与数据仓库架构设计

比较数据湖与数据仓库,设计基于对象存储和开放表格式的湖仓一体架构,实现批流统一的数据处理与治理。

20 0 0
2026-06-12
Hadoop 生态系统基础与实操

理解 Hadoop 分布式文件系统与 MapReduce 计算模型,搭建本地集群并运行经典的单词计数作业,奠定大数据基础。

19 0 0
2026-06-12
Apache Spark 大数据处理快速入门

使用 PySpark 编写分布式数据处理程序,学习 Spark DataFrame 操作、SQL 查询和常见性能优化,处理 TB 级数据集。

18 0 0
2026-06-12
Elasticsearch 全文搜索与数据分析

深入 Elasticsearch 搜索原理,掌握映射设计、DSL 查询、聚合分析及性能调优,搭建企业级搜索与日志分析平台。

21 0 0
2026-06-12
Apache Kafka 流处理平台实战

学习 Kafka 架构、主题分区、消费者组再均衡以及 Kafka Streams DSL,构建可靠的实时数据管道和事件驱动应用。

20 0 0
2026-06-12