开源代码加个壳,年收你 15 万美金——一次 RDS 迁移自建的成本审计

开源代码加个壳,年收你 15 万美金——一次 RDS 迁移自建的成本审计

一句话结论

我们把 6 个 RDS MySQL 集群迁到 EC2 自建,年省 $151,425(76%)。这不是什么黑科技,就是把云厂商帮你装好的 MySQL 自己装了一遍。


云数据库的定价逻辑

RDS 的本质是:在 EC2 上跑一个开源数据库,加一层管控面板,然后把价格翻一倍往外卖。

以 ap-east-1 区域 db.m5d.xlarge(4C 16G)为例:

部署方式 小时单价 倍率
EC2 同配置裸机 $0.277/hr
RDS Single-AZ $0.638/hr 2.3×
RDS Multi-AZ(2 节点) $1.276/hr 4.6×
RDS Multi-AZ DB Cluster(3 节点) $1.768/hr 6.4×

存储更离谱。同样的 gp3 磁盘:

EBS 直接挂载 RDS 存储(3 节点集群) 倍率
容量 $0.1056/GB-month $0.45/GB-month 4.3×
IOPS(超基线) $0.0066/IOPS-month $0.078/IOPS-month 11.8×
吞吐(超基线) $0.0528/MiBps-month $0.313/MiBps-month 5.9×

你没看错——同一块硬盘、同一个 IOPS,挂在 RDS 上比挂在 EC2 上贵 12 倍

那管控面板值这个差价吗?


管控做了什么:收钱的自动化

RDS 管控提供的核心能力:

  1. 自动备份 —— 一个 cron + mysqldump/xtrabackup 的事
  2. 自动故障切换 —— 开源社区 orchestrator/MHA 免费且更灵活
  3. 自动小版本升级 —— 这不是优点,这是灾难(下面细说)
  4. 监控 —— Performance Insights 还要额外收费,基础 CloudWatch 指标连 QPS 都看不到
  5. 参数管理 —— 一个 my.cnf 的事,还不让你改一半参数

真正恶心的是强制升级。

MySQL 8.0 社区还在维护,RDS 直接宣布 EOL,逼你升 8.4。理由?”降低我们的运维成本”。从来不考虑:

  • 你的 ORM 框架兼不兼容
  • 你的 CDC 组件(Canal/Debezium)测过没有
  • 你的 SQL 在新优化器下会不会回退

云厂商嘴上说”客户第一”,实际做的每一个决策都是”降低自己的运维成本,把风险转嫁给客户”。一个 Terraform apply 就把你几百个集群的引擎版本全换了,你连说不的机会都没有。


实战:6 个集群的迁移账本

原始配置

# RDS 规格 节点数 存储 IOPS 月费
1 db.m5d.4xlarge (16C 64G) 3 500GB gp3 12,000 $6,208
2 db.m5d.2xlarge (8C 32G) 3 500GB gp3 12,000 $3,626
3 db.m5d.2xlarge (8C 32G) 3 500GB gp3 12,000 $3,626
4 db.m5d.xlarge (4C 16G) 3 400GB gp3 12,000 $2,290
5 db.m5d.large (2C 8G) 3 200GB gp3 3,000 $735
6 db.t3.small (2C 2G) 2 100GB gp2 $114
合计 $16,598/月

迁移后实际 EC2 配置

# EC2 规格 节点数 存储 IOPS 月费
1 m7i.xlarge (4C 16G) 3 350GB gp3 3,000 $734
2 m6i.2xlarge (8C 32G) 3 350GB gp3 3,000 $1,283
3 r6i.xlarge (4C 32G) 3 350GB gp3 3,000 $858
4 m7i.xlarge (4C 16G) 3 350GB gp3 3,000 $734
5 c7i.large (2C 4G) 3 100GB gp3 3,000 $296
6 规划 t3.small 2 100GB gp3 3,000 $74
合计 $3,979/月

成本分析

RDS 年费:$199,174
EC2 年费:$47,749
年省:$151,425(76%)


省钱的三个层次

第一层:平移替换(省 50-60%)

单纯把 RDS 换成同规格 EC2 自建 MySQL,不做任何优化。省钱来源:

  • 去掉 RDS 的”管控溢价”(计算 2-3 倍)
  • 去掉存储的”托管溢价”(IOPS 12 倍)
  • 使用 gp3 基线 3000 IOPS 免费额度(RDS 要额外收钱)

第二层:基于监控降配(再省 15-20%)

拉取 48 小时监控后发现:

集群 CPU Avg 存储 IOPS 实际使用 配置 IOPS 利用率
集群 1(16C 64G) 2.5% 20 12,000 0.17%
集群 5(2C 8G) 17.5% 0.7 3,000 0.02%
集群 6(2C 2G) 4.3% 0.8

集群 1 尤其荒唐:RDS 上跑着 16C 64G 的大实例,实际 CPU 平均 2.5%,存储 IOPS 日常仅 20。我们直接降到 4C 16G,一个集群就省了 $65,687/年

这不是什么高难度操作——拉个 CloudWatch 指标谁都会。但如果你用着 RDS,你永远不会去想”我要不要降配”,因为:

  1. RDS 没有直观的利用率告警(连 QPS 都不给你看,要开 Performance Insights 再付钱)
  2. 修改实例规格需要重启,Multi-AZ 切换有风险
  3. 反正不是自己的钱,KPI 不考核基础设施成本

第三层:总结

层次 动作 节省比例
平移替换 RDS → EC2 同规格 50-60%
监控降配 基于实际负载缩减规格 +15-20%
合计 ~76%

这只是冰山一角

上面 6 个集群的 RDS 年费不到 20 万美金。在我们整个基础设施账单里,这连 5% 都不到。

如果把所有托管服务(RDS、ElastiCache、MSK、OpenSearch……)全部迁移自建,按同样的比例估算,年省百万美金量级不是梦话。

而在国内互联网行业,很多公司一年在云上花几千万甚至几个亿人民币。按我们实测的 76% 节省比例,实际可能只需要 20-30% 的预算就能跑同样的业务。剩下的钱去哪了?去了云厂商的毛利率报表里。


更进一步:EC2 到 IDC 自建

如果 RDS 到 EC2 能省 76%,那 EC2 到自建 IDC 呢?

EC2 本身也有”云溢价”。同样一台 4C 16G 的服务器:

方案 月成本估算 相对 EC2
EC2 On-Demand $202/月
EC2 1年 Savings Plan $140/月 0.7×
IDC 自建(含托管+带宽+折旧) $60-80/月 0.3-0.4×

经验法则:当你的年云支出超过 1000 万人民币(约 $140 万美金),就应该认真评估自建 IDC 或混合架构了。在这个规模下:

  • 你已经有足够的运维团队
  • 服务器采购有议价空间
  • 网络带宽成本可以通过 BGP 直连大幅降低
  • 3 年折旧后硬件几乎是”免费”的

工程师的价值

$151,425/年

这是一个 DBA 花两周时间做迁移评估 + 执行带来的年化收益。这笔钱:

  • 在北京够招一个资深工程师
  • 在二线城市够招两个
  • 比 90% 的”降本增效”项目 ROI 都高

而且这还只是”小试牛刀”——6 个中小规格集群。

别忘了,这原本 20 万刀的开支上面,云厂商还要再收 8% 的企业支持服务费(Enterprise Support)。$199,174 × 8% = $15,934/年,又是一个工程师的工资。

放大到整个公司:如果你一年在云上花 1000 万人民币,8% 就是 80 万——够养一个 3-4 人的专职运维团队了。而云厂商的”支持服务”给你什么?一个工单系统、一个响应 SLA、偶尔帮你提个 limit。你自己的工程师调个参数 5 分钟搞定的事,走工单要等 24 小时。

如果你是多云架构,情况更糟:

  • 每家云都要交一份支持费
  • 每家的 API/控制台/计费模型都不一样,运维工具要写多套
  • 跨云网络打通本身就是成本(专线、VPN、流量费)
  • 出了问题两家互相甩锅,你夹在中间当传话筒

如果你已经有了 IDC 自建能力,云上的托管服务就是在给云厂商交智商税。 同样的 MySQL、同样的 Redis、同样的 Kafka——跑在你自己机房的服务器上,性能更好、延迟更低、成本是云上的 1/5。

云厂商的销售会告诉你”自建运维成本高””要招人要管理”。但他们不会告诉你:

  • 他们的托管服务本身就是你花钱让别人招了个运维
  • 这个运维收费是市场价的 5-10 倍
  • 这个运维还会强制你升级、限制你改配置、监控还要额外付费
  • 你交的 8% 支持费,换来的是一个工单系统和一句”建议您升级到最新版本”

AI 才是真正的降本增效工具

很多人问:自建听起来好,但你哪来的人力做迁移评估、写管控脚本、搞高可用切换?

答案是:AI。

这次 6 个集群的迁移评估,从拉取 RDS 配置、查询 CMDB 元数据、获取 EC2 实际规格、抓取 AWS 官方定价 JSON、计算成本对比、生成汇总报告——全程由 AI Agent 完成。一个 DBA 坐在终端前给指令,AI 负责执行。整个成本审计过程不到 2 小时。

传统做法?开会讨论 → 安排人力 → 写脚本拉数据 → Excel 算半天 → 做 PPT 汇报 → 领导审批。一个月能出结果算快的。

AI 在这次迁移中具体干了什么

环节 AI 完成的工作 替代的传统人力
配置审计 批量调用 AWS CLI 拉取 6 个集群的 RDS/EC2 规格、存储、IOPS 运维工程师手动登录控制台逐个记录
价格计算 从 AWS Bulk Pricing JSON(几百 MB)中精确提取区域定价 打开 N 个定价页面手动比对
CMDB 关联 SSH 跳板机查询内部元数据库,关联 RDS 与 EC2 实例 运维人员人肉翻 CMDB
监控分析 批量拉 CloudWatch 48h 数据,识别降配机会 人工看图、拍脑袋
报告生成 直接输出结构化 Markdown/飞书文档 写 Word、排版、发邮件
迁移工具 生成数据校验脚本、切换 checklist、回滚方案 高级 DBA 手写

为什么很多公司 AI “烧 token 看不到效果”

每月花几万块 token 费,产出是什么?让员工用 ChatGPT 润色周报、用 Copilot 补全几行代码、开会用 AI 做纪要。这些场景有价值吗?有。但 ROI 约等于零——因为省的是”5 分钟”,不是”5 万美金”。

AI 降本增效的正确姿势:让 AI 去做那些”能做但没人力做”的事。

成本审计就是典型。每个公司都知道云上可能有浪费,但:

  • 没人有空去逐个实例拉监控
  • 没人愿意花一周时间算 Excel
  • 算完了还不一定能推动执行

AI 把这个成本降到接近零。一次对话 = 一次完整审计 = 发现 $15 万/年的节省机会。 这次对话消耗的 token 费?不到 $5。

ROI 对比

场景 投入 年化产出 ROI
AI 润色周报/邮件 $100/月 token 省 10 小时人力 ≈ $500
AI 辅助写代码 $200/月 token 省 20% 开发时间 ≈ $2,000 10×
AI 做基础设施成本审计 $5 token $151,425/年 30,000×

差距不是 AI 本身的问题,是你让 AI 做什么的问题。

让 AI 帮你写”尊敬的领导,现将本周工作汇报如下”——这不叫降本增效,这叫浪费电。让 AI 帮你查明白每年有 15 万美金在被云厂商白拿——这才叫降本增效。

给管理者的建议

  1. 别让 AI 去做”锦上添花”的事,让它去做”本来没人力做”的事
  2. 基础设施成本审计是最容易落地的高 ROI 场景——数据结构化、API 可调用、结果可量化
  3. 把 AI 当成一个 7×24 的初级运维,给它明确的指令和工具权限,它能干的活比你想象的多
  4. 衡量 AI 投入的标准不是”省了多少时间”,而是”做了多少原来做不了的事”

结语

云厂商不是做慈善的。RDS 的商业模式就是:

把 MySQL 官网免费下载的二进制文件装到你本来就在付费的 EC2 上,加一个 Web 控制台,然后跟你收 2-12 倍的溢价

这门生意的毛利率,做梦都能笑醒。

而你只需要一个懂 MySQL 的工程师、一套开源高可用方案(orchestrator + ProxySQL)、一个备份脚本——就能省下 75% 的钱,还能获得更大的灵活性。

不是所有上云都是降本。绝大多时候,下云才是。