写在实际选型之前:分布式架构不是拼积木,是找瓶颈
做中间件、云原生、DB-first 选型,最容易踩的坑不是技术不会,而是上来就想“一步到位”。我在不同团队都见过同一个问题:项目一启动,架构师先画一张大图,中间件排一排,Kafka、Redis、Spring Cloud 全往上堆,数据库这边还在纠结要不要分库分表。结果系统上线后,最忙的不是业务开发,而是维护这些中间件的人。
这个行业里,“分布式架构”这四个字被过度神话了。一说分布式,就觉得要高可用、高并发、弹性伸缩,非得上云原生,非得全部微服务化。但我做过的真实项目中,有把 Redis 当数据库用的,有坚持 DB-first 撑了三年没加过缓存的,也有从第一行代码就走云原生路线的。它们都能跑,区别在于团队清楚自己要解决什么问题。
选型真正要回答的不是“哪个技术更好”,而是“瓶颈到底在哪”。把一个单体业务拆成三十个微服务,如果数据库还是那张大表,性能瓶颈不会消失,只会从应用层挪到数据库层。同理,上不上云原生,不该由“潮流”决定,而该由“是否有弹性伸缩的需求”决定。今天这篇文章,我想把我这些年参与过的、看过的一线项目选型过程完整拆开,把中间件、云原生、DB-first 这几条路的核心逻辑讲透,然后给出一个可以复用的落地判断模型。
适合谁看呢?适合那些刚从单体往分布式过渡、正在写架构方案却被反复评审问住的团队;也适合那些已经被中间件堆怕了、想弄清楚到底该留住什么、砍掉什么的开发负责人。看完你应该能拿出属于自己的选型结论,而不是照抄别人的架构模版。
1. 先解决一个认知问题:分布式架构到底在解决什么问题
1.1 三个热词代表的是三种基因
中间件、云原生、DB-first,这三个词经常被放在一起聊,但它们在技术谱系上根本不是同一个维度的东西。中间件是解决“组件间通信与协作”的软件设施,云原生是一种“从基础设施到应用全链路云化”的架构哲学,而 DB-first 是“以数据库为核心反推应用设计”的建模思路。三者可以组合,但组合前得先想清楚,你缺的到底是哪一个能力。
我习惯用一个生活类比:把业务系统想成一家餐厅。
DB-first 的思路是“厨房优先”——先把灶台、锅碗瓢盆弄明白,菜怎么做都围着厨房的能力转。分库分表就是多开几个灶眼,读写分离就是炒菜和备菜分开进行。这套逻辑的重心在“存储和数据处理能力本身”。
中间件的思路是“传菜系统优先”——前厅点到菜,后厨做出来,中间得有人端、有窗口放、有呼叫铃通知。Kafka 是传菜履带,Redis 是临时台面上的成品菜,消息队列是后厨出菜和前台上菜的缓冲。这套逻辑的重心在“流程协作和状态传递”。
云原生的思路是“按需开分店”——客人多了临时加桌,闲时把档口关掉省成本。容器是标准化的灶台模块,K8s 管的是开几家店、店开在哪儿,服务网格管的是店与店之间怎么协作。这套逻辑的重心在“弹性、标准化和全局调度”。
理解了差异,再看选型就会清醒很多:你的业务现在缺的是更多灶眼,还是更快传菜,还是灵活开店?三个问题答案完全不同,对应的投入方向也不同。
1.2 分布式改造的最大谎言:拆了就能扛住
我见过一个典型的失败案例。某业务系统并发上来了,开发团队决定微服务化,把用户、订单、支付、商品四个模块拆开,服务间用 Feign 调,注册中心上 Nacos,网关上 Spring Cloud Gateway。折腾三个月拆完,压测发现瓶颈不在服务间调用,而在订单表的写入锁竞争。
这就是典型的“用拆分解决存储问题”——完全用错了工具。微服务化解决的是“团队协作效率”和“局部弹性扩缩容”的问题,它不能让你的数据库凭空多扛几倍写入。拆完之后,数据库连接数翻了几倍,每个服务都要连库,连接池配置稍不注意,数据库先被 Connection 打满了。
反过来,也见过一个反例。某团队一开始就选了 DB-first,所有逻辑都围绕 MySQL 做,表设计用了大量冗余字段避免 JOIN,写入用分库分表中间件,半年内业务量翻了四倍没加一台应用服务器。但后来业务变得复杂,各种统计需求、多维查询全压上来,SQL 写得越来越变态,团队每天都在跟分页、跨分片查询搏斗。这就是只盯着存储层优化,忽视了“变化中的业务”才是架构最大的变量。
所以我强调的是:分布式架构的第一步,不是选技术,而是做瓶颈诊断。你得先回答五个问题——
- 当前瓶颈是 CPU 还是 IO,是连接数还是数据量?
- 当前架构里哪个环节最先到极限,是应用层还是存储层?
- 并发模型是读多写少还是写多读少,峰值是平时的几倍?
- 业务对一致性的容忍度是多少,能不能接受最终一致?
- 团队有多少人有中间件运维能力,出问题能不能兜住?
这五个问题回答完,选型才不是拍脑袋。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 中间件、云原生、DB-first 三足鼎立,谁都不能包治百病
2.1 中间件:分布式系统的“交通警察”
中间件的本质是一层“软件定义的连接层”,它在应用和数据、应用和应用之间做转发、缓冲、削峰、同步。常见的角色有这几类:
- 缓存中间件,典型代表 Redis,解决读压力,把热点数据提前放到内存。
- 消息中间件,典型代表 Kafka、RocketMQ、RabbitMQ,解决流量削峰、异步解耦、事件通知。
- 分布式协调中间件,典型代表 ZooKeeper、Nacos、Etcd,解决服务发现、配置管理、分布式锁。
- 搜索中间件,典型代表 Elasticsearch,解决复杂查询和海量日志检索。
中间件的价值在于把通用的技术问题从业务代码里抽离出来。以 Redis 做中间件为例,它在分布式系统里的最常见用法不是存缓存,而是做三件事:一是做分布式锁,解决多实例下并发写同一资源的互斥问题;二是做热点计数器,应付秒杀、限流、幂等等场景的瞬时高频写入;三是做异步缓冲,用 List 结构模拟队列,承接突发流量后再慢慢落库。
但 Redis 做中间件也有它最典型的坑。用 Redis 做分布式锁时,很多人都知道用 SETNX,但很少有人注意锁的“持有者标识”和“过期时间续期”。我见过一次线上事故:一个定时任务在 Redis 上加了锁,任务执行时间超过锁的过期时间,锁自动释放,另一个实例抢到锁又执行了一遍,结果出现重复打款。根因就是锁没做续期,也没有校验“只有持有者才能释放”。
用中间件要掌握两个原则:第一,中间件是“为业务减负”,不是“为系统增负”,加一个中间件,就要多一份监控、多一份运维、多一份故障演练;第二,中间件的选型要跟着数据量走,而不是跟着技术热度走——日 PV 百万级,用 Redis 做缓存绰绰有余,日 PV 千万级就要考虑 Redis Cluster 或者分层缓存。
2.2 云原生:重新定义“部署、运行、治理”这套工序
云原生跟中间件最大的区别是:它不解决单点技术问题,而是解决整个系统的“运行形态”问题。容器化、编排调度、微服务化、声明式 API、不可变基础设施,这一整套理念,本质上是在说一件事——让系统具备快速交付、弹性伸缩、故障自愈的能力。
这套东西到底值不值得上?我的答案是,得看你的交付场景和规模曲线。
如果你是给客户做私有化交付的项目,客户环境千奇百怪,有装麒麟的、有装 CentOS 的、还有内网不允许连外网的。这时候容器化的价值非常大,把应用打成镜像,交付时只要一台干净的机器加一个容器运行时,就能跑起来,环境差异问题直接消灭掉。K8s 在这里的核心价值不是弹性伸缩,而是“环境一致性”。
如果你是面向 C 端的大型互联网业务,峰值流量可能是平时的十倍甚至几十倍。这时候云原生的价值在于弹性——流量涨上来,Pod 副本数跟着涨,流量退了,Pod 缩回去,成本跟着省下来。Spring Cloud + K8s 的组合,很多团队都在用,前者解决微服务之间的治理,后者解决微服务的承载和调度。
但我必须泼一盆冷水:如果团队只有两三个人,业务并发几千 QPS,上云原生是给自己找罪受。K8s 的学习曲线和运维复杂度是实打实的,一个集群要管 etcd、控制平面、工作节点、网络插件、存储插件,出一次故障排查链路极长。我在小团队见过最理性的做法是:用 Docker Compose 跑服务编排,先保证环境一致性,等团队和业务规模上来再考虑 K8s。
真正专业的做法是不把云原生当目标,把它当手段。你的系统需要解决的是自动扩缩容、不可变部署、故障自愈,那云原生的组件就是正解;如果你的系统只需要稳定跑着,每周发一次版,那过度设计就是最大的成本浪费。
2.3 DB-first:被低估的“反微服务”方案
这两年“DB-first”这个词又开始热门,尤其在单体架构回归的声音里。它的核心主张是:把数据库设计和数据模型当作系统架构的起点,应用服务的拆分要围数据模型展开,而不是按业务功能随意切。
这套思路的本质是尊重“数据是核心资产,数据关系是最高约束”。微服务架构一个常被忽视的代价是:分库分表之后,原本一个事务能解决的问题,变成了跨服务分布式事务问题;原本一次 JOIN 能查出来的数据,变成了多次 API 调用拼接。DB-first 则是反过来,先把数据边界画清楚,能不分就不分,能不拆就不拆,让应用尽量贴近数据。
合适的场景很明确:
- 内部管理系统、后台运营系统、报表系统。这些系统的并发量没那么夸张,但事务和一致性要求很高,DB-first 的模型能显著降低开发复杂度。
- 数据关系紧密的业务,比如 ERP、财务系统、订单核心系统,数据之间的关联度极高,拆开服务容易,拆开数据就是灾难。
- 中小规模的实时交易系统,单库能够承载业务量,添加 Redis 缓存、消息队列就能满足需求。
但不合适的场景同样明显:
- 数据量已经到了单库极限,必须分片,这时候 DB-first 的“单库模型”反而成了束缚。
- 业务希望快速迭代、独立发布、按各自领域自治,这时候数据全部集中在一个库,会变成发布节奏的卡点。
说到底,DB-first 从来不该和“不用中间件”“不上云”画等号。我在项目中见过最舒服的组合是:核心交易数据走 DB-first,单库事务保证一致性;热数据和报表走独立的读库,用 Canal 同步过去;秒杀、异步通知等瞬时流量用 Redis 和消息队列去承接。数据库、中间件、云原生在这里不是互斥选项,是一个连续光谱。
3. 落地方法论:用“瓶颈优先级”代替“技术偏好”
3.1 一张决策表,把架构选型变成填空题
选型最怕凭感觉。我把自己用的一套逻辑沉淀成了一张决策表,按优先级排序来判断技术投入方向,你们可以直接拿去做方案评审的依据。
先看容量上限。预估三年后的峰值数据量和 QPS,判断单机或单库是否能扛住。能扛住,DB-first 一定是性价比最高的,优先把表结构设计做扎实,把索引和 SQL 优化做透。扛不住,再往下走。
再看一致性要求。资金、库存、订单这类强一致业务,数据模型和事务边界要优先保障,DB-first 或微服务+分布式事务框架,比如 Seata,是正解;点赞数、操作日志、短信通知这类弱一致场景,用消息中间件做异步解耦,成本最低。
再看运维能力。团队有没有专门的中间件运维人员,决定了能不能驾驭 Kafka、Redis Cluster 这类重组件。没人会运维却硬上,等于给自己埋雷。运维薄弱的团队,优先选择托管云服务,减少自建组件。
最后看弹性需求。业务量是否有明显的波峰波谷,例如活动运营、直播带货系统。有,云原生容器化扩缩容是必需品;没有,虚拟机和固定副本数完全够用。
3.2 三种典型场景的具体组合方案
基于上面的逻辑,我整理了三套实战组合,直接对应最常见的业务场景。
第一套,demo 型或交付型项目。典型特征是:需求边界清晰、并发量有限、交付周期紧、客户环境不可控。我推荐“DB-first + 轻量中间件”:一个 MySQL 主库加一个只读从库,Redis 做会话共享和热点缓存,EMQX 或自研 WebSocket 网关做实时通信。核心表设计花两周做到第三范式,对外接口按领域划分 Controller,内部直接用 Mapper 操作数据。整个系统一台 8 核 16 G 的服务器就能轻松跑起来,交付时用 Docker Compose 打包,客户环境只要装一个 Docker。这套方案的运维成本极低,出了问题定位也快,客户满意度反而高,因为从来没遇到过组件层面的故障。
第二套,结构化核心业务系统。典型特征是:业务逻辑复杂、模块边界清晰、并发有一定压力、团队有一定规模。我推荐“分布式服务 + 数据库级治理”:Spring Cloud Alibaba + Nacos + Gateway + Sentinel 做服务和流量治理,数据库按业务域拆成独立的库,订单库、库存库、用户库每个库单独做主从;库与库之间的跨域调用,禁止服务间 SQL 直查,统一走 OpenFeign 接口,保证数据访问的合规路径。核心链路用 Seata 的 AT 模式保证分布式事务,Redis 做热点缓存,Kafka 做业务事件的异步通知。这套方案能扛住千万级日活,也能把团队协作边界划得很清楚。
第三套,高并发互联网系统。典型特征是:海量流量、峰值明显、快速迭代、对可用性要求极高。我推荐“云原生基础设施 + 分层中间件 + 最终一致存储”:应用全部容器化部署在 K8s 集群,配置 HPA 按 CPU 和 QPS 弹性扩缩容;流量入口用 SLB 加 Nginx 加网关三层负载;Redis Cluster 做热点数据和分布式锁,Kafka 做全量事件流和数据管道,ES 做查询和检索;存储层按业务特性混合部署,交易类走分布式数据库或者分库分表中间件,日志和流水走列式存储如 ClickHouse。
这三套方案没有谁更高级,只有谁更匹配。第一套方案里的团队如果硬上 K8s,交付周期能拖长一倍;第三套方案里的团队如果坚持 DB-first,光分库分表的成本就能吃掉多半的迭代精力。
4. 结合热词具体聊聊:Redis 做中间件、Spring Cloud 分布式定时任务
4.1 Redis 做中间件时,这七个问题必须提前问自己
Redis 是分布式系统里最常见的中间件,但越是常用越容易用糙。我在实际踩坑之后,总结了一套自检清单,每次接入 Redis 之前都会过一遍。
数据要不要持久化。缓存可以丢,丢了再从数据库加载,但分布式锁、未支付订单状态这类数据丢了会出大问题。选型时 RDB 加 AOF 混合持久化更稳妥,能兼顾恢复速度和数据完整性。
锁的粒度定多大。用 Redis 做分布式锁,锁粒度太粗,一个用户加锁,其他用户都等着,性能反而比不加锁还差;锁粒度太细,锁数量膨胀,管理和死锁风险都增大。我的习惯是按“业务资源的最小有效单位”加锁,比如“用户 ID + 商品 SKU”当 key,而不是只锁用户 ID。
缓存穿透和击穿的防护做没做。Redis 扛不住“查询不存在的数据”和“热点 key 同时过期”这两类流量。前者要加布隆过滤器拦截,后者要把过期时间加上随机值打散,否则高峰期数据库会被瞬间打崩。
热 key 和大 key 怎么处理。单个 key 的 QPS 超过 Redis 单实例能力的 50%,就该考虑本地缓存加 Redis 的多级缓存方案。大 key 会导致 Redis 单线程处理卡顿,常见解决办法是拆分和压缩,比如把大 List 拆成多个小 List。
数据序列化方式选什么。建议直接用 JSON 或者 Protobuf,不要用 JDK 原生序列化,否则跨语言消费数据时会痛不欲生,数据体积大三倍不止。
过期删除策略靠不靠谱。Redis 的惰性删除加定期删除在 key 数量多时会产生延迟,如果缓存 key 有严格的过期时间要求,要考虑主动触发校验加被动清理兜底。
集群挤压和内存淘汰怎么配。缓存要设置 maxmemory 和合理的淘汰策略,一般选 allkeys-lru,但要保证不能被淘汰的关键数据单独放到不淘汰的实例中。
这套清单不复杂,但能挡住绝大多数线上事故。我见过最惨的一次事故,就是因为缓存穿透防护没做,活动上线一小时,数据库被打了三个亿的无效查询,最后整个集群 CPU 99%,核心交易接口全部超时。
4.2 Spring Cloud 架构下的分布式定时任务:四个方案横评
“分布式部署后,定时任务怎么确保同一时刻只有一个实例在执行?”这是 Spring Cloud 微服务化转型过程中必踩的坑。我把它单独拎出来说,因为这个问题在单体时代根本不存在,一旦拆成多实例部署,定时任务就从“技术问题”变成了“正确性问题”。
方案一,分布式锁 + 定时任务,最简单。基于 Redis 的 SETNX 实现任务级互斥,各实例到点先抢锁,抢到锁的执行任务,没抢到的直接跳过。适合任务频率低、执行时间短、不需要分片的场景。QPS 要求不高,胜在实现简单,不需要引入额外组件。
方案二,使用专业调度中间件,比如 XXL-JOB。它是目前国内 Spring Cloud 项目里受众最广的方案,中心化调度加执行器模式,自带控制台、任务分片、失败重试、动态调整 cron 表达式。任务量中等、希望把任务编排可视化的团队,用这个方案的好处是开发团队可以自己维护,不依赖外部平台。
方案三,使用云厂商的托管调度平台,比如 SchedulerX。适合业务量剧增、部署集群扩到几十上百个节点的阶段。云平台负责可靠性和分布式调度,团队不再关心任务漂移、日志丢失这些问题,按量付费。缺点是和云厂商绑定,非云环境没法用。
方案四,基于消息的事件驱动定时任务。把“到点触发”改成“事件触发”,用 MQ 广播时间事件,各实例消费并判断自己是否需要执行。这套设计适合有大流量事件背景的团队,能天然避开分布式锁的竞争问题,但能力要求高,不适合大部分业务场景。
横向对比下来,我的建议是:项目初期直接用方案一,一个注解加一个 Redis 锁就能保证幂等性;等任务数量超过二十个,再考虑方案二。多花一点时间在任务监控和告警上,比一开始就上重型调度平台更符合实际需要。
5. 数据一致性:所有架构方案的隐藏代价
选型时大家最关注性能、扩展性,但真正决定系统能不能稳定跑下去的,往往是“数据一致性”这个隐藏代价。分布式改造越激进,一致性治理越复杂,这两者成正比。
先给一个直接结论:不是所有数据都要求强一致,过度的强一致追求是分布式系统性能的天敌。正确的做法是给数据分类,按业务容忍度分开处理。
核心数据用强一致方案。支付金额、库存扣减、用户余额,这类数据必须强一致,无论用什么架构,都要保住这条底线。实现上优先保证事务边界完整,尽量单机或单库内完成;确实突破了单库限制,用 Seata 的 AT 模式或 TCC 方案来补充。我这里有个铁律:能在一个事务里解决的,绝不引入分布式事务框架,每引入一次分布式事务,系统的性能和复杂度都上一个台阶。
过程状态用最终一致方案。订单状态流转、积分累计、消息已读未读,这类数据的中间状态允许短暂不一致,但最终必须一致。做法是“本地事务 + 消息表 + MQ 重试”,核心要点是:业务操作和消息发送在一个本地事务里完成,消息发送失败则定时任务重试,消费端做好幂等。这套方案比分布式事务框架简单得多,可靠性也足够。
衍生数据用异步同步方案。搜索索引、缓存预热、报表统计、日志聚合,这类数据延迟几分钟甚至几小时都可以。用 Canal 监听 binlog,或者直接用 MQ 异步同步,最简单高效。为了这类数据的实时性去搞强一致方案,是本末倒置。
我见过很多团队在一致性方案上反复折腾,最后发现最优解就在最朴素的路径里。拿库存超卖举例,单体时代就是数据库 UPDATE stock SET num = num - 1 WHERE sku_id = ? AND num > 0 一行 SQL 的事;微服务拆完之后,得用 Redis 预扣减加 MQ 异步落库加定时任务对账。但如果你问该不该为了用 Redis 而拆掉这行 SQL,我的答案是:只有并发真正超过单库承受能力时,才值得引入这套复杂度。
6. 故障治理和排查:架构越大越要储备实战预案
6.1 中间件故障的十五分钟黄金排查路径
无论选什么架构,最终都会遇到中间件故障。我平时排查分布式系统问题,习惯按固定路径走,十五分钟内基本能定位八成问题。这套路径分享出来供你们参考:
第一步,先看监控大盘,确定是哪个节点异常。CPU 飙升、内存溢出、连接数打满、MQ 消息堆积、Redis 命中率下降,不同指标指向完全不同的组件;别跳着查,先确认故障面。
第二步,确认是慢还是挂。看响应时间和错误率指标,API 响应整个变慢,大概率是数据库慢查询或者 Redis 阻塞;错误率集中,大概率是下游服务熔断或者网络异常。
第三步,查日志,按 traceId 串链路。分布式系统的排查离不开全链路追踪,如果没接 SkyWalking 或类似工具,至少确保日志里打印了 traceId,才能快速把一次请求的多个服务日志串起来。
第四步,看线程堆栈和 GC 日志。如果应用节点 CPU 高但流量不大,绝大多数是代码死循环、Full GC 频繁、连接池耗尽,用 jstack 看到底卡在哪个方法,用 jstat 看 GC 频率。
6.2 典型故障案例速查表
| 故障现象 | 排查路径 | 常见根因 | 应急处理 |
|---|---|---|---|
| 接口偶发超时 | 查调用链 → 查中间件耗时 | Redis 大 key 导致阻塞 | 拆分大 key,加本地缓存 |
| 数据库连接池被打满 | 查连接占用 → 查慢 SQL | 缓存穿透导致大量 DB 查询 | 布隆过滤器拦截无效 key |
| MQ 消息堆积 | 看消费者消费速率 → 看消费者日志 | 消费者逻辑慢或下游阻塞 | 临时扩容消费者实例 |
| 定时任务重复执行 | 查任务日志 → 查锁状态 | 分布式锁过期未续期 | 锁续期 + 持有者标识 |
| 跨服务调用失败率上升 | 查熔断状态 → 查下游响应 | 下游服务雪崩 | 打开熔断,快速降级 |
| 缓存命中率骤降 | 查 key 过期策略 → 查缓存写入链路 | 大批 key 同一时间失效 | 过期时间加随机值 |
这张表不能解决全部问题,但能帮你把大部分线上故障从“恐慌模式”变成“按步骤处理”。我特别强调一点:排查故障时先恢复再用根因分析,先保业务,再复盘。很多团队卡在“一定要马上找出根因”这一点上,反而把故障时间拖长了。正确的做法是先摘除故障节点、切流到备用节点、重启消费者,恢复服务后再慢慢分析根因。
7. 选型的终点不是技术,是运维和成本
技术文章经常聊“怎么做”,但很少聊“代价是什么”。架构选型到最后,拼的不是哪套方案更酷,而是哪套方案更省心、更省钱。我在两个维度上分享一些真实体会。
运维维度。自建组件会面临磁盘告警、节点宕机、版本升级、安全补丁、数据备份等一系列日常维护任务,每个组件都是持续的运维负债。云托管组件是按量付费、开箱即用、自动备份,但会在深度定制和响应延迟上受制于人。选型的核心判据可以量化为:团队每月投入在中间件运维上的人天是多少。如果超过三个人天,就该认真考虑替换成托管服务;如果每个组件都需要两人以上专职维护,说明组件太重了,架构把这些机器养成了大爷。
成本维度。很多团队只看到云原生的“弹性成本节省”,没算过迁移和改造的隐形成本。从虚拟机迁到容器,从单体拆成微服务,从自建中间件迁到云托管,每一轮迁移都要消耗至少一到两个季度的开发人力,期间还会伴随线上故障风险。我的经验是:只有当业务增长率能覆盖迁移成本、云资源账单比当前的固定资产加运维人力更省时,才值得动手。
我自己的判断标准很简单:选型的优先级永远是“业务稳定性 > 团队熟悉度 > 成本可控性 > 技术先进性”。新技术再先进,团队没人会,就是事故隐患;再省钱,稳定性扛不住,就是赔本买卖。每次做架构评审,我都会问团队一句话:这个技术,你们团队有人能在大半夜三点爬起来处理故障吗?如果答案是不确定,那就先别上。
8. 如果你正要做分布式架构改造,这是我的最后几点建议
踩过足够多的坑之后,我对架构选型的态度越来越保守。所谓“分布式架构落地方法论”,说白了就三件事:
第一,从业务瓶颈开始,而不是从技术栈开始。拿到一个项目,先画数据流图,标出容量和延迟的瓶颈点,再决定在哪些环节引入哪些组件。为了某个中间件的“技术含量”去改造架构,是本末倒置。
第二,用演进思维代替一步到位。架构不是画出来就完事的,是跟着业务一起长出来的。初期尽量精简,保持单体或者模块化单体,等到瓶颈真的出现,再在瓶颈处引入中间件、拆分服务、弹性扩缩容。任何架构方案都要保留“可演进”的接口,而不是把路一次堵死。
第三,运维能力和监控体系要比架构本身先行。一个组件上线前,先确认监控告警、日志采集、容量预估这三件事都做好了。中间件本身不会出问题,出问题的往往是没人盯着它、不知道它啥时候异常、等异常发生了才发现。
最后一句话想分享给我的同行们:架构选型没有银弹,也没有永恒的正确答案。中间件、云原生、DB-first 都是工具箱里的工具,真正的方法论是知道自己要解决什么问题,然后把手里的工具用在正确的位置上。希望这篇梳理能帮你在下一次架构评审时少一些犹豫,多一些笃定。
