乐途乐途
主页
  • 计算机基础

    • TCP/IP
    • Linux
    • HTTP
  • 数据库

    • SQL
    • MySQL 5.7
  • 编程语言

    • C
    • C++
    • Java SE
    • Python2
    • Python3
  • 数据格式

    • JSON
    • XML
  • 认证与安全

    • JWT
  • 工具

    • Markdown
  • Git

    • GitFlow
  • Quartz

    • Quartz
  • Java

    • Maven 入门
    • Maven 进阶
    • MyBatis
    • Spring
    • Spring MVC
  • Java

    • Spring Boot
    • Spring Cloud
    • Spring Cloud Alibaba
    • Spring Security
    • Spring AI
    • Spring Batch
    • Kafka
    • Java 设计模式
  • 缓存

    • Redis
  • 搜索引擎

    • Elasticsearch
  • 分布式协调

    • ZooKeeper
联系
阿里云
主页
  • 计算机基础

    • TCP/IP
    • Linux
    • HTTP
  • 数据库

    • SQL
    • MySQL 5.7
  • 编程语言

    • C
    • C++
    • Java SE
    • Python2
    • Python3
  • 数据格式

    • JSON
    • XML
  • 认证与安全

    • JWT
  • 工具

    • Markdown
  • Git

    • GitFlow
  • Quartz

    • Quartz
  • Java

    • Maven 入门
    • Maven 进阶
    • MyBatis
    • Spring
    • Spring MVC
  • Java

    • Spring Boot
    • Spring Cloud
    • Spring Cloud Alibaba
    • Spring Security
    • Spring AI
    • Spring Batch
    • Kafka
    • Java 设计模式
  • 缓存

    • Redis
  • 搜索引擎

    • Elasticsearch
  • 分布式协调

    • ZooKeeper
联系
阿里云
  • 学习路径
  • 第1章 消息队列与 Kafka 概述

    • 章节导读
    • 消息队列基础
    • Kafka 概述
    • Kafka 为什么快
  • 第2章 快速上手:单机环境搭建

    • 章节导读
    • 环境准备与安装
    • 快速启动
    • Topic 管理
  • 第3章 核心概念:主题、分区与日志

    • 章节导读
    • Topic
    • Partition
    • Offset
    • Segment 与存储结构
  • 第4章 生产者详解

    • 章节导读
    • Producer 概述
    • Producer 发送机制
    • Producer 分区策略
    • Producer 幂等与事务
    • Producer 配置
  • 第5章 消费者与消费组

    • 章节导读
    • Consumer 概述
    • Consumer Group 消费组
    • Consumer 分区分配策略
    • Consumer Offset 提交
    • Consumer 多线程
    • Consumer 配置
  • 第6章 Broker 与控制器

    • 章节导读
    • Broker 概述
    • Broker 配置
    • Controller
    • KRaft 共识协议
  • 第7章 副本与数据可靠性

    • 章节导读
    • 副本机制
    • ISR 与副本同步
    • Leader 选举
    • ACK 与一致性保证
    • 高水位与 Leader Epoch
  • 第8章 存储与性能优化

    • 章节导读
    • 存储架构
    • 日志清理与压缩
    • Page Cache 与零拷贝
    • Producer 性能优化
    • Consumer 性能优化
    • Broker 性能优化
  • 第9章 生产环境运维与监控

    • 章节导读
    • Topic 管理
    • Kafka 运维工具
    • 监控
    • 常见故障排查
  • 第10章 Kafka生态与面试考点

    • 章节导读
    • Kafka 生态全景
    • 面试高频 30 题

Kafka 生态全景

定义与作用

Kafka 不是一个孤立的产品,而是现代数据架构的"中枢神经系统"。理解 Kafka 在生态中的位置,才能理解它为什么被称为"分布式系统的基础设施"。

Kafka 在大数据生态中的位置

核心生态组件

组件作用与 Kafka 的关系
Kafka Connect数据导入/导出框架Kafka 自带,连接外部系统
Kafka Streams轻量级流处理库Kafka 自带,Java 库
Schema RegistrySchema 管理(Avro/Protobuf)Confluent 提供,配合序列化
MirrorMaker 2跨集群数据复制Kafka 自带,容灾与多活
KSQL / ksqlDBSQL 流处理Confluent 提供,流式 ETL
Cruise Control自动均衡与运维LinkedIn 开源

典型数据链路

链路 1:日志采集与分析

应用日志 → Filebeat → Kafka → Logstash → Elasticsearch → Kibana

链路 2:CDC 数据同步

MySQL Binlog → Debezium → Kafka → Kafka Streams → 数据仓库

链路 3:实时推荐

用户行为 → Kafka → Flink → Redis/特征存储 → 推荐服务

链路 4:事件溯源(Event Sourcing)

领域事件 → Kafka(Compact Topic) → Kafka Streams → 物化视图

面试高频考点

Q:Kafka 和传统消息队列(RabbitMQ、ActiveMQ)的本质区别是什么?

A:不是速度比较,而是设计哲学的根本差异:

传统消息队列Kafka
核心目标消息投递流式数据平台
数据模型队列(消费后删除)日志(持久化、可重放)
消费模式PushPull
顺序性单队列有序分区内有序
扩展性纵向扩展横向扩展(分区)
适用场景RPC 调用、任务分发事件流、数据分析、日志聚合

Kafka 不只是一个"消息队列",它是一个分布式提交日志(Distributed Commit Log)。这个定位决定了它的持久化、可重放、多订阅等能力远超传统 MQ。

上一页
章节导读
下一页
面试高频 30 题