这几年做微服务落地和容器化改造的朋友,基本都会撞上同一个选型难题:服务发现到底用 ZooKeeper、etcd 还是 Consul。我见过不少人张口就是“服务发现用 ZooKeeper 准没错”,也有人坚持“云原生时代直接上 etcd”,还有人把 Consul 当成注册中心的完全体。三个方案我都实际部署过、改造过、踩过坑,这里把它们在服务发现这个命题上的设计逻辑、实现细节和适用边界一次性拆开,希望能帮你把“哪个好”这个问题,变成“哪个更适合我的系统”。
1. 服务发现本身是个什么问题
1.1 从“配置里写 IP”到“动态通讯录”
在单体应用和传统虚拟机的年代,服务调用基本靠固定 IP 和负载均衡器完成。下线一台机器改一下 Nginx 配置,或者更新一下配置文件里的地址列表,问题不大。真正让“服务发现”变成刚性需求的是微服务和容器化:实例随时弹性扩缩容、调度系统把容器漂移到任意节点、Pod 重建后 IP 完全变化。你不可能每次扩容都手动改一遍配置文件,更不可能让调用方在代码里写死某台容器的地址。
这种情况下,服务发现要回答的问题就两个:第一,服务实例上线后,怎么把“我叫什么、我在哪、我提供什么端口”告诉别人?第二,调用方想找某个服务时,怎么拿到当前所有可用实例,并且在实例上下线时收到通知?前者叫注册,后者叫订阅或查询。落到工程实现上,通常还要加上第三个动作——健康检查:把已经挂掉或者状态异常的实例及时从目录里摘掉,否则调用方会不停地把请求打到坏节点上。
用生活里的例子理解就是:以前你记着每个人的固定电话号码,现在大家都换手机、常搬家,你需要一个动态通讯录,号码变了要自动更新,人联系不上要自动注销。ZooKeeper、etcd、Consul 本质上都是想当这样一套“动态通讯录 + 总机”的角色。
1.2 三者的共同点:分布式存储加变更通知
别被三套术语绕晕,它们的核心模型其实高度一致:都是一个分布式的共享存储,加上一套监听变更的通知机制。
ZooKeeper 的数据模型是树形命名空间,你可以在路径上创建节点存数据,客户端可以监听某个路径下子节点的变化;etcd 是带前缀的扁平 KV 存储,你用 /services/order-service/ 这种 key 前缀组织数据,客户端可以在前缀上挂 Watch,一有写操作就收到事件;Consul 则把服务名、实例地址、健康状态组织成服务目录,客户端要么通过 HTTP 接口查,要么直接 DNS 查,还可以用 blocking query 长轮询感知变化。
所以,单论“能不能用来做服务发现”,三者都能。真正拉开差距的是另外三件事:内部一致性协议怎么设计、健康检查做到什么程度、以及提供服务发现能力时附带了多少工程化的治理功能。接下来的几个部分,就是围绕这三个维度的一场实际较量。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 一致性仲裁:ZAB、Raft 与 Gossip 的取向差异
2.1 ZooKeeper:ZAB 全序广播,先保证节点不乱
ZooKeeper 用的 ZAB 协议,设计目标是在一个由 Leader 主导的集群里,对每个写请求做全序广播。每个写操作都会得到一个全局递增的 zxid,Follower 按照 zxid 顺序应用事务。这样做的好处很明确:整个集群的状态不会乱,客户端无论连到哪个节点,数据版本都是一致的。
但需要注意一个细节:ZooKeeper 的读请求可以在任意节点处理,如果某台 Follower 的事务复制滞后,客户端会读到旧数据。也就是说,ZooKeeper 提供的不是线性一致性,而是顺序一致性和最终一致性——写请求有全序,但读请求可能读到历史版本。
这个特性直接影响服务发现的效果。客户端拉取服务列表时,如果连到一台复制滞后的节点,可能拿到一份已经过期但仍然合法的列表。通常这不致命,因为客户端会再通过 Watch 收到后续变更。但如果你把 ZooKeeper 用在“必须立刻看到最新状态”的强一致场景,比如分布式锁、Leader 选举,就要小心读滞后的影响。这也是为什么 ZK 的 Watch 只能保证“一定次数内至少触发一次”,而不是严格不重不漏。
对服务发现场景来说,ZK 的核心资产其实是“临时节点 + 会话超时”:客户端连接建立会话,创建的临时节点和会话生命周期绑定,会话中断后节点会被自动清理。这个机制天然适合服务上下线,也是很多老系统选择 ZK 做注册中心的根本原因。
2.2 etcd:Raft 强一致日志复制,MVCC 版本化为 Watch 加分
etcd 使用 Raft 协议,写请求只有被大多数节点确认后才会提交。相比 ZAB,Raft 把“选主、日志复制、安全性”拆成几个更清晰的子问题,工程实现和理解都更友好。更重要的是,etcd 基于多版本并发控制(MVCC)存储数据,每次写操作都会产生一个单调递增的 revision。
这个设计给服务发现带来的实际价值非常大:Watch 不仅仅是“我告诉你变了”,而是“我知道从哪个版本开始变了”。客户端可以带着上次看到的 revision 重新发起 Watch,把断连期间错过的所有事件全部重放一遍。ZooKeeper 的 Watcher 是一次性的,触发一次就失效,你必须手动重挂;如果重挂之前又发生了变更,这个事件就丢了,只能靠下一次查询兜底。etcd 的 prefix Watch 配合 revision 回放,从机制上解决了事件丢失问题。
此外,etcd 用 gRPC 作为客户端协议,所有语言都有现成的 protobuf 定义,接入体验比 ZK 的私有协议要顺滑不少。后面我还会提到租约机制,它在“临时节点”这个语义上和 ZK 形成了有趣的对照。
2.3 Consul:Raft 加 Serf Gossip,服务目录最终一致显然更务实
Consul 的一致性设计是三者里最“分层”的。它有一个基于 Raft 的 KV 存储,用来保存服务目录、会话、ACL Token 这类关键数据,保证数据中心内部强一致。但节点之间的成员关系、健康状态传播,用的是 HashiCorp 自研的 Serf Gossip 协议。
这是什么意思呢?服务注册最终会落到 Server 节点的存储里,由 Raft 保证一致;但某个实例健康还是不健康,这个状态先在本机 Agent 上产生,再通过 Gossip 协议在集群里扩散。所以严格来说,Consul 的服务目录是最终一致性模型——不同客户端在极短时间窗口内可能看到略有差异的列表。
很多刚接触 Consul 的人会因此担心可靠性。实际用下来,这种“目录最终一致”在服务发现场景里反而非常务实。服务发现本身不要求每个客户端在同一微秒看到完全相同的列表,只要求坏实例能被快速摘除、新实例能尽快出现。Gossip 协议在节点规模大、健康检查频繁的场景下,比把所有状态都压在 Raft 日志里更省资源,也更容易扩展到数据中心级别。Consul 的 WAN Gossip 能把多个数据中心的 Server 串起来,这是 ZK 和 etcd 都没有原生支持的能力。
2.4 “一致性越强”不等于“服务发现越强”
这一点可能是整篇里最重要的一句话:对服务发现来说,强一致不是充分条件,甚至有时不是必要条件。 服务发现里真正有价值的,是“不丢事件”和“快速收敛”。前者影响客户端能不能及时感知实例上下线,后者影响故障恢复的速度。
ZK 和 etcd 的强一致设计,让它们在分布式锁、配置发布这类要求全局统一视图的场景里非常可靠;但服务目录的变更,天然允许客户端在极短时间内看到不同版本。Consul 用 Raft 保证关键数据安全,再用 Gossip 把健康状态高效散播,这个组合明显是冲着“大规模服务发现”去的。
我自己在生产里见过两种极端:一个是把 ZooKeeper 用作注册中心,结果每个服务启动时都去写临时节点、挂 Watcher,大量连接把单机连接数打满;另一个是把 Consul 用在分布式锁上,结果因为服务目录本身不是严格强一致,锁竞争激烈时出现预期之外的竞态。说到底,你得先明白自己的核心诉求是“协调”还是“发现”,再回头看协议设计。
3. 注册与订阅:三种实现方式的工程对比
3.1 ZooKeeper:临时节点加 Watcher
ZooKeeper 的注册逻辑依赖节点类型。持久节点创建后一直存在,临时节点则会话存活期间存在,会话结束后 ZK 自动把它删掉。服务实例启动时,在固定路径下创建临时节点,节点内容存实例的 IP、端口、元数据:
java复制CuratorFramework client = CuratorFrameworkFactory.newClient(
"zk1:2181,zk2:2181,zk3:2181",
new RetryOneTime(1000));
client.start();
// 注册:创建临时节点,会话断开后节点自动消失
client.create()
.creatingParentContainersIfNeeded()
.withMode(CreateMode.EPHEMERAL)
.forPath(
"/services/order-service/192.168.1.10:8080",
"{\"weight\":80}".getBytes(StandardCharsets.UTF_8));
// 订阅:获取子节点列表并注册 Watcher
client.getChildren()
.usingWatcher(event -> {
// 注意:Watcher 是一次性的,触发后必须重新 getChildren
// 并重新挂 Watcher,否则后续变更收不到
})
.forPath("/services/order-service");
这里最大的坑就是消费端 Watcher 的“一次性”语义。你必须在事件回调里重新执行 getChildren 并重新挂 Watcher,否则一次通知之后,你对这个路径的监听就永久失效了。团队里如果对框架封装不熟,很容易在这里写出“刚开始能感知变更,跑几天后彻底失灵”的代码。生产环境我更推荐直接用 Curator 的 PathChildrenCache,它内部封装了 Watcher 重挂和事件缓存,但这不代表你可以不看文档乱用——事件队列积压、重复回放、连接重连后的缓存重建,都是需要理解底层的。
另一个要注意的是会话和连接的关系。ZK 客户端断连后,只要在会话超时时间内恢复,临时节点还在;超过超时时间,节点会被清理,但旧实例这时候可能还在对外提供请求。也就是说,ZK 摘除节点不等于摘除流量,客户端需要配合负载均衡层面的重试和熔断。
3.2 etcd:租约加前缀 Watch
etcd 的注册模型建立在租约(Lease)之上。你把一个 key 关联到租约上,租约到期后 key 自动删除;正常运行时,应用通过 KeepAlive 不断续租。这个机制实现的效果和 ZK 临时节点一样,但多了一层灵活性:你可以精确控制 TTL,而且租约可以挂多个 key。
下面是一段简化的注册和订阅逻辑:
go复制cli, _ := clientv3.New(clientv3.Config{
Endpoints: []string{"http://etcd-1:2379", "http://etcd-2:2379", "http://etcd-3:2379"},
})
// 创建租约,TTL 设为 15 秒
lease, _ := cli.Lease.Grant(context.Background(), 15)
// 把服务实例注册到租约上
key := "/services/order-service/192.168.1.10:8080"
cli.Put(context.Background(), key, "{\"weight\":80}", clientv3.WithLease(lease.ID))
// 循环续租,保持存活性
keepAliveCh, _ := cli.KeepAlive(context.Background(), lease.ID)
// 订阅前缀变化
watchCh := cli.Watch(context.Background(), "/services/order-service", clientv3.WithPrefix())
for {
select {
case resp := <-watchCh:
// 处理新增和删除事件
}
}
用租约做服务注册,本质上是一种 TTL 模式:只要续租不停,key 就一直在;续租断了且 TTL 到期,key 自动消失。这里有两个工程化建议。第一,TTL 不建议设太短,否则网络抖动会导致频繁误摘除,建议 10 到 30 秒之间;也不建议设太长,否则实例真的挂了,恢复服务的延迟会很高。第二,KeepAlive 失败后,客户端需要立即主动重新注册或者恢复续租链,不能干等。这个逻辑看起来简单,但要写健壮并不容易,需要考虑客户端断连期间的补偿。
和 ZK 方案最明显的差异是:etcd 完全没有“业务健康”检查能力。租约活着,key 就存在,哪怕你的服务进程已经因为死锁导致请求全面超时。所以你需要自己维护一个健康检查进程:健康时续租,不健康时主动撤销租约,或直接把 key 删掉。这个模式如果做得好,效果不逊于 Consul;做不好,就会出现“名录上全是活着的服务,流量打过去全是错误”。
3.3 Consul:Agent 加 Catalog 加 DNS
Consul 的架构多了一个 Agent 层。每个节点跑一个本地 Agent,服务实例向本机 Agent 注册,Agent 再把数据上报给 Server 集群中的 Catalog。客户端查询时,既可以走 HTTP API,也可以直接走 DNS 接口。
实际注册一个带健康检查的服务,一般是这样:
json复制{
"ID": "order-01",
"Name": "order-service",
"Address": "192.168.1.10",
"Port": 8080,
"Check": {
"HTTP": "http://192.168.1.10:8080/health",
"Interval": "10s",
"Timeout": "3s",
"DeregisterCriticalServiceAfter": "90s"
}
}
bash复制curl -X PUT --data @service.json http://127.0.0.1:8500/v1/agent/service/register
注册之后,调用方如果想找 order-service,最传统的方式是 DNS 查询:
bash复制dig @127.0.0.1 -p 8600 order-service.service.consul SRV
返回结果里会附带端口和实例地址。这个能力对老系统特别友好,Prometheus、Nginx、部分 RPC 框架只要做最小改动就能接上。HTTP API 则是给程序用的,比如通过 GET /v1/catalog/service/order-service 拿到实例列表,或走 blocking query 长轮询来感知变更。
Consul 从设计第一天就是“服务发现的完整方案”:注册、发现、健康检查、多数据中心、KV 配置、Service Mesh,都是一等公民。后面这一长串衍生功能(Consul Template 动态渲染 Nginx 配置、Connect 给服务间流量加密、基于服务名的 Intentions 策略)我们可以不展开,但它们说明了一个事实:Consul 不是把服务发现当成附加功能,而是整个产品的主线。
3.4 抽象层级不同,决定了你要做多少事
把三者放到一起看,发现它们的“抽象层级”完全不同。ZooKeeper 提供的是分布式原语,你要自己在上面实现注册、订阅、健康检查;etcd 提供的是 KV 和 Watch 机制,你也要自己组装服务发现逻辑;Consul 则直接把你需要的服务发现能力接口化,连健康检查探针都内置了。
这没有绝对好坏。在 ZK 和 etcd 上自研注册中心,自由度很高,可以完全贴合自己的框架和协议,但开发和维护成本是你自己的;用 Consul,上线快、治理功能全面,可越到后面,你越需要理解它的 Agent、Gossip、ACL、多数据中心这些概念,排障复杂度也随之上升。
我见过不少团队用 ZK 或 etcd 自研注册中心,代码写得也不差,最后死于两个隐蔽问题:一个是健康检查只做了“连接层”没做“业务层”,服务假死时摘不掉节点;另一个是监控不到位,注册表膨胀、Watch 风暴来的时候毫无预警。所以,不要只看注册和订阅那几行代码,要把健康检查、容量管理、故障预案整套算进去,再决定自己动手还是用现成方案。
4. 健康检查与故障摘除:真正的分水岭
4.1 ZooKeeper 的会话心跳不等于业务健康
用一个实际例子说明这个问题。你在 ZK 上注册了 20 个订单服务实例,某一天其中一个实例的内存被业务代码慢慢打满,进程还没退出,TCP 连接还活着,甚至 JVM 还在正常跑。ZK 会怎么判断?它只关心客户端会话是否存续,只要心跳还在,临时节点就一直在。结果就是:调用方照常把流量打过去,实例实际已经无法正常处理请求,等到进程崩溃、连接断开,ZK 才发现并删除节点。
所以 ZK 的健康检查本质上只是“连接层存活检测”,不是“业务存活检测”。做服务发现时,你必须自己实现一个健康检查循环:检测到业务异常,就主动调用 delete 删除对应临时节点,或者整体关闭客户端让会话断掉。这里有个细节,很多人在代码里直接把整个客户端关了,结果影响的是这个客户端管理的所有节点,不只是那一个异常实例,需要格外小心。
另外,ZK 的会话超时还受服务端参数限制。服务端 tickTime 默认 2000ms 时,会话超时的合法范围是 4 秒到 40 秒,客户端申请的超时值会被服务端强行钳制。想把摘除速度做到秒级,单靠调 session timeout 并不能随心所欲,还要考虑网络抖动导致的误摘。
4.2 etcd 的租约同样是“下线超时”而非“业务探活”
etcd 的租约机制比 ZK 的会话更灵活,但它能感知的层面依然很浅。KeepAlive 能证明“客户端进程还活着、网络还通着”,仅此而已。服务进程 CPU 满载、数据库连接池耗尽、端口不再 accept,etcd 一个都看不到。
要想在生产环境用 etcd 做好摘除,正确姿势是把健康检查做在续租逻辑前面。比如你的服务每隔 5 秒检查一次自己的健康状态,健康就触发 KeepAlive,不健康就主动撤销租约。注意,这套逻辑必须放在独立协程或者独立进程里,不能和被检查的业务逻辑共用同一个线程池,否则业务线程阻塞后,健康检查线程也一起卡死,照样续租,等于白做。
还有一个容易忽略的坑:etcd 的事件,尤其是历史版本,不会永久保留。默认的后端存储会定期做 compaction。如果客户端长时间离线,revision 已经被压缩,重放 Watch 时会拿到一条压缩错误。所以基于 etcd 做注册中心时,要么把 compaction 的时间窗口调得足够长,要么让客户端用当前快照重建状态,不能完全依赖事件回放。
4.3 Consul 把健康检查做成了一等公民
Consul 内置的检查类型很全:HTTP 请求检查、TCP 拨号检查、脚本执行检查、gRPC 健康检查协议,还有 TTL 模式。每种都能设置检查间隔、超时时间、连续失败多少次之后进入 critical 状态。最有用的参数是 DeregisterCriticalServiceAfter:服务进入 critical 状态超过设定时间后,Consul 自动把服务实例从目录里移除,彻底避免“僵尸实例”长期占用注册表。
这个设计对生产环境的帮助是立竿见影的。我管理过一个基于 Consul 的消息服务集群,某个节点因为磁盘 IO 异常导致业务端口响应超时,HTTP 检查连续几次失败后实例自动进入 critical,再过了 90 秒直接注册表除名,调用方只能查到剩余健康实例。整个过程完全没有人工介入,比 ZK 和 etcd 那套“靠连接断开来推断”的方案可靠得多。
但 Consul 的健康检查也有自己的风险。健康检查本身会消耗资源,尤其是脚本检查,如果脚本写得慢或者间隔设得太短,会把 Agent 拖死。同一个节点上千个服务的健康检查都指向同一个脚本,一旦脚本执行时间超过检查间隔,Agent 的 goroutine 就会不断膨胀,最终整个节点的 Agent 不可用。常规经验是:健康检查间隔不要小于 5 秒,脚本执行时间要设置超时上限,能不跑脚本就用 HTTP 或 TCP 检查。
4.4 健康检查能力的横向对比
| 维度 | ZooKeeper | etcd | Consul |
|---|---|---|---|
| 是否内置健康检查 | 否,只有会话心跳 | 否,只有租约 TTL | 是,HTTP/TCP/脚本/gRPC |
| 是否能感知业务异常 | 不能 | 不能 | 能,取决于检查定义 |
| 故障摘除手段 | 会话超时清临时节点 | 租约到期清 key | critical 状态可自动注销 |
| 误摘风险 | 网络分区时易误摘 | 网络分区时易误摘 | 可通过连续失败次数和宽限期控制 |
结论很直接:如果业务健康检查是你做服务发现的第一诉求,Consul 在这条赛道上基本没有对手。ZK 和 etcd 不是不能做,而是你得在应用层补齐整套探活逻辑,而且大概率补得不如 Consul 完善。
5. 集群部署与运维成本:决定你愿不愿意长期持有
5.1 ZooKeeper 的运维琐事不少
ZooKeeper 集群部署需要至少 3 个节点,建议用奇数节点。每台服务器都要单独写一个 myid 文件,节点配置里的 server 列表要预先定好。生产环境里,数据和事务日志要分盘存放,dataLogDir 单独放 SSD,否则事务日志的 fsync 延迟会直接拖慢整个集群的写性能。
bash复制wget https://downloads.apache.org/zookeeper/zookeeper-3.9.2/apache-zookeeper-3.9.2-bin.tar.gz
tar -zxvf apache-zookeeper-3.9.2-bin.tar.gz
cd apache-zookeeper-3.9.2
cp conf/zoo_sample.cfg conf/zoo.cfg
# 编辑 conf/zoo.cfg
# clientPort=2181
# dataDir=/data/zk
# dataLogDir=/data/zk/log
# tickTime=2000
# initLimit=10
# syncLimit=5
# server.1=zk1:2888:3888
# server.2=zk2:2888:3888
# server.3=zk3:2888:3888
# 在每台机器的 dataDir 下写入不同的 myid
echo "1" > /data/zk/myid
ZooKeeper 的运维风险点在内存和连接数。它把整棵数据树放在内存里,如果往 ZK 里塞了大量带数据的节点,GC 压力会越来越大,严重的会表现为集群周期性停顿。单 IP 默认连接数限制也很低,大量微服务实例注册时,必须调高 maxClientCnxns。还有 jute.maxbuffer 限制单节点数据大小,不适合拿 ZK 当“大配置存储”用。
另外,大数据生态对 ZK 有很强的路径依赖。HDFS 的 NameNode 高可用要靠 ZKFC 选主,HBase 的 HMaster 选举和 RegionServer 在线列表也靠 ZK 维护,老版本 Kafka 依赖 ZK 管理 broker 元数据。在这类系统里,你基本没得选,要么继续用 ZK,要么跟随社区做大规模迁移。入门者常看到“Hadoop 和 ZooKeeper 整合实战”,本质上就是这些分布式系统把 ZK 当作协调底座,而不是单纯拿它做服务发现。
5.2 etcd 的轻部署与隐形成本
etcd 的部署在三个里最轻:一个静态二进制,没有 JVM,没有复杂的启动脚本。3 个节点构成集群的关键参数就是 initial-cluster 和 peer 地址,启动顺序有讲究,第一台启动后要等第二台加入。
bash复制etcd --name etcd-1 \
--initial-advertise-peer-urls http://192.168.1.11:2380 \
--listen-peer-urls http://192.168.1.11:2380 \
--listen-client-urls http://192.168.1.11:2379,http://127.0.0.1:2379 \
--advertise-client-urls http://192.168.1.11:2379 \
--initial-cluster etcd-1=http://192.168.1.11:2380,etcd-2=http://192.168.1.12:2380,etcd-3=http://192.168.1.13:2380 \
--initial-cluster-token etcd-cluster \
--initial-cluster-state new \
--data-dir /var/lib/etcd
真正需要在意的是存储层的健康。etcd 把数据持久化在 bbolt 文件里,历史版本不清理的话,文件会持续膨胀;执行 compaction 之后,底层文件碎片还不一定被释放,通常需要手动 defrag。磁盘写入延迟对 Raft 提交速度影响极大,云盘性能突变时,etcd 会表现出明显的写超时。
还有一个所有人都绕不开的点:Kubernetes 的集群状态全都放在 etcd 里。很多团队想当然地“复用”K8s 的 etcd 做业务服务发现,这是很危险的做法。K8s 自身对 etcd 的读写模式已经非常重,业务再往里塞大量服务目录和 Watch,两边的压力会互相影响;一旦 etcd 故障,K8s 集群和业务注册中心一起挂,故障域完全重合。真要基于 etcd 做服务发现,必须独立部署一套集群,和 K8s 的 etcd 物理隔离。
5.3 Consul 的架构复杂度与收益
Consul 的部署模型比前两者多了一层。每个节点要跑一个 Agent,Agent 分 client 和 server 两种角色。真正参与 Raft 投票的只有 server 节点,client Agent 负责转发请求、维护本机服务注册信息和健康检查。Gossip 协议使用固定端口,数据中心内部一般用 8301 端口做成员同步和故障检测,server 之间用 8302 端口做 WAN 同步。
bash复制# 启动第一个 server
consul agent -server -bootstrap-expect=3 \
-data-dir=/opt/consul -node=consul-1 \
-bind=192.168.1.21 -client=0.0.0.0 -ui \
-datacenter=dc1 -retry-join=192.168.1.22 -retry-join=192.168.1.23
多数据中心是 Consul 的招牌能力。不同数据中心的 server 通过 WAN gossip 互联,客户端在 dc1 可以直接查询 dc2 的服务目录,配合 DNS 响应里返回的远程实例地址,能实现跨机房服务发现。这套能力在 ZK 和 etcd 上是完全没有的,后者做跨机房要么自己搭双集群做同步,要么在上层写代理转发。
Consul 的复杂度和收益是硬币两面。要理解 client、server、gossip、catalog、ACL 这些概念,排障门槛比 etcd 高不少。常见的问题包括:Agent 缓存了本地服务注册信息,重启后需要重新同步;ACL 开启后,Token 配置错误会导致客户端查询返回空目录;健康检查数量大时,server 的 CPU 和内存消耗直线上升。如果你只需要单数据中心、简单服务发现,用 Consul 会有点杀鸡用牛刀。
5.4 运维成本小结
从长期运维的实际体验看:etcd 部署最简单,但要盯 compaction、defrag、磁盘延迟;ZooKeeper 部署和连接管理最繁琐,JVM 调优和节点内存要持续关注;Consul 初始架构理解成本最高,但多数据中心和服务治理能力到位之后,日常维护反而比 ZK 更顺畅。想好自己的团队有没有精力维护,再决定选型。
6. 没有标准答案:场景驱动的选型清单
6.1 先回答一组判断题
与其问我“哪个好”,不如先过一遍这组判断题,答案指向基本就清楚了:
- 你的系统是否已经深度使用 ZooKeeper(比如 Hadoop、HBase、老版本 Kafka、Dubbo 默认注册中心)?
- 你的技术栈是否完全基于 Kubernetes,且不想额外维护一套注册中心?
- 你是否有明确的业务级健康检查需求,比如需要摘除“进程活着但服务不可用”的实例?
- 你是否需要跨数据中心的服务发现?
- 你的服务实例数量和变更频率是否很大,Watch / 长轮询的压力是否可能成为瓶颈?
- 你是否需要服务发现之外的分布式协调能力,比如分布式锁、Leader 选举?
- 你是否需要 DNS 接口,让 Nginx、Prometheus 这类传统组件也能无侵入地发现服务?
如果 1 和 6 为主,选 ZooKeeper;如果 2 为主,且只是“服务发现顺手要做”,可以考虑独立 etcd 或者直接复用 Kubernetes 自带的 DNS;如果 3 和 4 为主,Consul 几乎没有替代品;如果重点是 5,etcd 的 prefix Watch 和 MVCC 回放会比 ZK 的分散路径 Watch 更省心。
6.2 典型组合与容易掉进去的坑
常见的经典组合我直接列一下:Dubbo 老项目默认用 ZooKeeper 做注册中心,不必为了“新潮”硬换 etcd,ZooKeeper 的临时节点和 Dubbo 的生态结合得很好;Spring Cloud 的 Consul 组件是成熟选择,服务注册、健康检查、配置中心一套搞定;云原生环境下,Kubernetes 自带 Service 和 Endpoint 机制本身就是一套服务发现,etcd 只是底层存储,你通常不需要直接对接 API;自研 RPC 框架需要注册中心时,etcd 的轻量和 gRPC 生态最适合二次开发。
容易掉的坑我见过不少。最典型的是把 K8s 的 etcd 当业务注册中心,前面说过,必须隔离;第二个是把大块配置塞进 ZK 节点,导致 JVM 内存飙升和 GC 长暂停;第三个是用 Consul 存业务数据或当缓存层,它本质是服务目录和协调存储,不适合高吞吐 KV 读写;第四个是用 etcd 做分布式锁时忘了处理租约续期和 Revision 比较,造成锁超时后持锁方还在写数据。
6.3 我自己的选择逻辑
做服务发现选型,我踩过不少坑之后形成一套很朴素的方法。先明确两件事:我需不需要业务健康检查?我需不需要多数据中心?如果都是“要”,不用犹豫,直接 Consul。如果只是单机房、RPC 框架指定了注册中心,就跟着框架走,比如 Dubbo 就放心用 ZK,Spring Cloud 就按需选 Consul 或 Nacos。如果要做轻量自研,etcd 是最省力的底座,但要提前把租约续期、健康检查、compaction 监控这几个点写好。
至于 ZooKeeper,它如今更像是分布式协调系统中的“老大哥”:服务发现只是它能力的一部分,真正的强项在锁、选主、队列、屏障这些协调原语上。如果你的系统已经有一整套 ZK 的运维经验和监控体系,拿它做服务发现也没问题;但如果是从零开始,我一般不建议纯粹为了服务发现去新建一套 ZK 集群。最后提一个很小的经验:无论选哪个组件,注册表容量上限、健康检查频率、摘除宽限期,这三个参数一定要在设计文档里写清楚,并且做一次故障演练。我见过太多系统把这三个参数交给开发人员临时拍脑袋决定,结果真出故障时,要么摘不掉僵尸实例,要么健康检查太频繁把集群打崩。把这些想清楚,再回头看 ZAB、Raft、Gossip 的协议差别,你会更清楚自己到底想要什么。
