开源代码加个壳,年收你 15 万美金——一次 RDS 迁移自建的成本审计
开源代码加个壳,年收你 15 万美金——一次 RDS 迁移自建的成本审计
一句话结论
我们把 6 个 RDS MySQL 集群迁到 EC2 自建,年省 $151,425(76%)。这不是什么黑科技,就是把云厂商帮你装好的 MySQL 自己装了一遍。
云数据库的定价逻辑
RDS 的本质是:在 EC2 上跑一个开源数据库,加一层管控面板,然后把价格翻一倍往外卖。
以 ap-east-1 区域 db.m5d.xlarge(4C 16G)为例:
| 部署方式 | 小时单价 | 倍率 |
|---|---|---|
| EC2 同配置裸机 | $0.277/hr | 1× |
| RDS Single-AZ | $0.638/hr | 2.3× |
| RDS Multi-AZ(2 节点) | $1.276/hr | 4.6× |
| RDS Multi-AZ DB Cluster(3 节点) | $1.768/hr | 6.4× |
存储更离谱。同样的 gp3 磁盘:
| EBS 直接挂载 | RDS 存储(3 节点集群) | 倍率 | |
|---|---|---|---|
| 容量 | $0.1056/GB-month | $0.45/GB-month | 4.3× |
| IOPS(超基线) | $0.0066/IOPS-month | $0.078/IOPS-month | 11.8× |
| 吞吐(超基线) | $0.0528/MiBps-month | $0.313/MiBps-month | 5.9× |
你没看错——同一块硬盘、同一个 IOPS,挂在 RDS 上比挂在 EC2 上贵 12 倍。
那管控面板值这个差价吗?
管控做了什么:收钱的自动化
RDS 管控提供的核心能力:
- 自动备份 —— 一个 cron + mysqldump/xtrabackup 的事
- 自动故障切换 —— 开源社区 orchestrator/MHA 免费且更灵活
- 自动小版本升级 —— 这不是优点,这是灾难(下面细说)
- 监控 —— Performance Insights 还要额外收费,基础 CloudWatch 指标连 QPS 都看不到
- 参数管理 —— 一个 my.cnf 的事,还不让你改一半参数
真正恶心的是强制升级。
MySQL 8.0 社区还在维护,RDS 直接宣布 EOL,逼你升 8.4。理由?”降低我们的运维成本”。从来不考虑:
- 你的 ORM 框架兼不兼容
- 你的 CDC 组件(Canal/Debezium)测过没有
- 你的 SQL 在新优化器下会不会回退
云厂商嘴上说”客户第一”,实际做的每一个决策都是”降低自己的运维成本,把风险转嫁给客户”。一个 Terraform apply 就把你几百个集群的引擎版本全换了,你连说不的机会都没有。
实战:6 个集群的迁移账本
原始配置
| # | RDS 规格 | 节点数 | 存储 | IOPS | 月费 |
|---|---|---|---|---|---|
| 1 | db.m5d.4xlarge (16C 64G) | 3 | 500GB gp3 | 12,000 | $6,208 |
| 2 | db.m5d.2xlarge (8C 32G) | 3 | 500GB gp3 | 12,000 | $3,626 |
| 3 | db.m5d.2xlarge (8C 32G) | 3 | 500GB gp3 | 12,000 | $3,626 |
| 4 | db.m5d.xlarge (4C 16G) | 3 | 400GB gp3 | 12,000 | $2,290 |
| 5 | db.m5d.large (2C 8G) | 3 | 200GB gp3 | 3,000 | $735 |
| 6 | db.t3.small (2C 2G) | 2 | 100GB gp2 | — | $114 |
| 合计 | $16,598/月 |
迁移后实际 EC2 配置
| # | EC2 规格 | 节点数 | 存储 | IOPS | 月费 |
|---|---|---|---|---|---|
| 1 | m7i.xlarge (4C 16G) | 3 | 350GB gp3 | 3,000 | $734 |
| 2 | m6i.2xlarge (8C 32G) | 3 | 350GB gp3 | 3,000 | $1,283 |
| 3 | r6i.xlarge (4C 32G) | 3 | 350GB gp3 | 3,000 | $858 |
| 4 | m7i.xlarge (4C 16G) | 3 | 350GB gp3 | 3,000 | $734 |
| 5 | c7i.large (2C 4G) | 3 | 100GB gp3 | 3,000 | $296 |
| 6 | 规划 t3.small | 2 | 100GB gp3 | 3,000 | $74 |
| 合计 | $3,979/月 |
成本分析
RDS 年费:$199,174
EC2 年费:$47,749
年省:$151,425(76%)
省钱的三个层次
第一层:平移替换(省 50-60%)
单纯把 RDS 换成同规格 EC2 自建 MySQL,不做任何优化。省钱来源:
- 去掉 RDS 的”管控溢价”(计算 2-3 倍)
- 去掉存储的”托管溢价”(IOPS 12 倍)
- 使用 gp3 基线 3000 IOPS 免费额度(RDS 要额外收钱)
第二层:基于监控降配(再省 15-20%)
拉取 48 小时监控后发现:
| 集群 | CPU Avg | 存储 IOPS 实际使用 | 配置 IOPS | 利用率 |
|---|---|---|---|---|
| 集群 1(16C 64G) | 2.5% | 20 | 12,000 | 0.17% |
| 集群 5(2C 8G) | 17.5% | 0.7 | 3,000 | 0.02% |
| 集群 6(2C 2G) | 4.3% | 0.8 | — | — |
集群 1 尤其荒唐:RDS 上跑着 16C 64G 的大实例,实际 CPU 平均 2.5%,存储 IOPS 日常仅 20。我们直接降到 4C 16G,一个集群就省了 $65,687/年。
这不是什么高难度操作——拉个 CloudWatch 指标谁都会。但如果你用着 RDS,你永远不会去想”我要不要降配”,因为:
- RDS 没有直观的利用率告警(连 QPS 都不给你看,要开 Performance Insights 再付钱)
- 修改实例规格需要重启,Multi-AZ 切换有风险
- 反正不是自己的钱,KPI 不考核基础设施成本
第三层:总结
| 层次 | 动作 | 节省比例 |
|---|---|---|
| 平移替换 | RDS → EC2 同规格 | 50-60% |
| 监控降配 | 基于实际负载缩减规格 | +15-20% |
| 合计 | ~76% |
这只是冰山一角
上面 6 个集群的 RDS 年费不到 20 万美金。在我们整个基础设施账单里,这连 5% 都不到。
如果把所有托管服务(RDS、ElastiCache、MSK、OpenSearch……)全部迁移自建,按同样的比例估算,年省百万美金量级不是梦话。
而在国内互联网行业,很多公司一年在云上花几千万甚至几个亿人民币。按我们实测的 76% 节省比例,实际可能只需要 20-30% 的预算就能跑同样的业务。剩下的钱去哪了?去了云厂商的毛利率报表里。
更进一步:EC2 到 IDC 自建
如果 RDS 到 EC2 能省 76%,那 EC2 到自建 IDC 呢?
EC2 本身也有”云溢价”。同样一台 4C 16G 的服务器:
| 方案 | 月成本估算 | 相对 EC2 |
|---|---|---|
| EC2 On-Demand | $202/月 | 1× |
| EC2 1年 Savings Plan | $140/月 | 0.7× |
| IDC 自建(含托管+带宽+折旧) | $60-80/月 | 0.3-0.4× |
经验法则:当你的年云支出超过 1000 万人民币(约 $140 万美金),就应该认真评估自建 IDC 或混合架构了。在这个规模下:
- 你已经有足够的运维团队
- 服务器采购有议价空间
- 网络带宽成本可以通过 BGP 直连大幅降低
- 3 年折旧后硬件几乎是”免费”的
工程师的价值
$151,425/年。
这是一个 DBA 花两周时间做迁移评估 + 执行带来的年化收益。这笔钱:
- 在北京够招一个资深工程师
- 在二线城市够招两个
- 比 90% 的”降本增效”项目 ROI 都高
而且这还只是”小试牛刀”——6 个中小规格集群。
别忘了,这原本 20 万刀的开支上面,云厂商还要再收 8% 的企业支持服务费(Enterprise Support)。$199,174 × 8% = $15,934/年,又是一个工程师的工资。
放大到整个公司:如果你一年在云上花 1000 万人民币,8% 就是 80 万——够养一个 3-4 人的专职运维团队了。而云厂商的”支持服务”给你什么?一个工单系统、一个响应 SLA、偶尔帮你提个 limit。你自己的工程师调个参数 5 分钟搞定的事,走工单要等 24 小时。
如果你是多云架构,情况更糟:
- 每家云都要交一份支持费
- 每家的 API/控制台/计费模型都不一样,运维工具要写多套
- 跨云网络打通本身就是成本(专线、VPN、流量费)
- 出了问题两家互相甩锅,你夹在中间当传话筒
如果你已经有了 IDC 自建能力,云上的托管服务就是在给云厂商交智商税。 同样的 MySQL、同样的 Redis、同样的 Kafka——跑在你自己机房的服务器上,性能更好、延迟更低、成本是云上的 1/5。
云厂商的销售会告诉你”自建运维成本高””要招人要管理”。但他们不会告诉你:
- 他们的托管服务本身就是你花钱让别人招了个运维
- 这个运维收费是市场价的 5-10 倍
- 这个运维还会强制你升级、限制你改配置、监控还要额外付费
- 你交的 8% 支持费,换来的是一个工单系统和一句”建议您升级到最新版本”
AI 才是真正的降本增效工具
很多人问:自建听起来好,但你哪来的人力做迁移评估、写管控脚本、搞高可用切换?
答案是:AI。
这次 6 个集群的迁移评估,从拉取 RDS 配置、查询 CMDB 元数据、获取 EC2 实际规格、抓取 AWS 官方定价 JSON、计算成本对比、生成汇总报告——全程由 AI Agent 完成。一个 DBA 坐在终端前给指令,AI 负责执行。整个成本审计过程不到 2 小时。
传统做法?开会讨论 → 安排人力 → 写脚本拉数据 → Excel 算半天 → 做 PPT 汇报 → 领导审批。一个月能出结果算快的。
AI 在这次迁移中具体干了什么
| 环节 | AI 完成的工作 | 替代的传统人力 |
|---|---|---|
| 配置审计 | 批量调用 AWS CLI 拉取 6 个集群的 RDS/EC2 规格、存储、IOPS | 运维工程师手动登录控制台逐个记录 |
| 价格计算 | 从 AWS Bulk Pricing JSON(几百 MB)中精确提取区域定价 | 打开 N 个定价页面手动比对 |
| CMDB 关联 | SSH 跳板机查询内部元数据库,关联 RDS 与 EC2 实例 | 运维人员人肉翻 CMDB |
| 监控分析 | 批量拉 CloudWatch 48h 数据,识别降配机会 | 人工看图、拍脑袋 |
| 报告生成 | 直接输出结构化 Markdown/飞书文档 | 写 Word、排版、发邮件 |
| 迁移工具 | 生成数据校验脚本、切换 checklist、回滚方案 | 高级 DBA 手写 |
为什么很多公司 AI “烧 token 看不到效果”
每月花几万块 token 费,产出是什么?让员工用 ChatGPT 润色周报、用 Copilot 补全几行代码、开会用 AI 做纪要。这些场景有价值吗?有。但 ROI 约等于零——因为省的是”5 分钟”,不是”5 万美金”。
AI 降本增效的正确姿势:让 AI 去做那些”能做但没人力做”的事。
成本审计就是典型。每个公司都知道云上可能有浪费,但:
- 没人有空去逐个实例拉监控
- 没人愿意花一周时间算 Excel
- 算完了还不一定能推动执行
AI 把这个成本降到接近零。一次对话 = 一次完整审计 = 发现 $15 万/年的节省机会。 这次对话消耗的 token 费?不到 $5。
ROI 对比
| 场景 | 投入 | 年化产出 | ROI |
|---|---|---|---|
| AI 润色周报/邮件 | $100/月 token | 省 10 小时人力 ≈ $500 | 5× |
| AI 辅助写代码 | $200/月 token | 省 20% 开发时间 ≈ $2,000 | 10× |
| AI 做基础设施成本审计 | $5 token | $151,425/年 | 30,000× |
差距不是 AI 本身的问题,是你让 AI 做什么的问题。
让 AI 帮你写”尊敬的领导,现将本周工作汇报如下”——这不叫降本增效,这叫浪费电。让 AI 帮你查明白每年有 15 万美金在被云厂商白拿——这才叫降本增效。
给管理者的建议
- 别让 AI 去做”锦上添花”的事,让它去做”本来没人力做”的事
- 基础设施成本审计是最容易落地的高 ROI 场景——数据结构化、API 可调用、结果可量化
- 把 AI 当成一个 7×24 的初级运维,给它明确的指令和工具权限,它能干的活比你想象的多
- 衡量 AI 投入的标准不是”省了多少时间”,而是”做了多少原来做不了的事”
结语
云厂商不是做慈善的。RDS 的商业模式就是:
把 MySQL 官网免费下载的二进制文件装到你本来就在付费的 EC2 上,加一个 Web 控制台,然后跟你收 2-12 倍的溢价。
这门生意的毛利率,做梦都能笑醒。
而你只需要一个懂 MySQL 的工程师、一套开源高可用方案(orchestrator + ProxySQL)、一个备份脚本——就能省下 75% 的钱,还能获得更大的灵活性。
不是所有上云都是降本。绝大多时候,下云才是。