光大银行 SKE 缺口定制工作量与不定制边界评估
结论
一线提出的问题可以拆成两件事:
- 产线复核每个缺口如果做定制,大致需要多少人天。
- 明确哪些内容适合作为项目定制,哪些内容需要进入产品路线图,哪些内容应直接排除项目定制承诺。
当前建议口径:
| 类型 |
能力范围 |
建议 |
| 可进入项目定制评估 |
第三方 K8s 只读/轻管理纳管、跨集群统一检索、跨集群基础观测入口、Harbor 批量清理废弃镜像、应用负载手动弹性扩缩、部分产品层 RBAC/CRD 管理(待定) |
适合让产线评估工作量,可沉淀为 SKE 产品能力 |
| 适合产品版本规划 |
K8s 集群/应用级备份、高可用架构(待定)、跨集群策略下发、跨集群应用分发、资源配额管理、统计报表与计量、AI 算力虚拟化、AI 算力调度、自监控面板、数据安全性(待定)、操作审计 |
需要跨团队设计和版本节奏,不宜仅作为一次性项目定制 |
| 需要厂商/硬件前置确认 |
海光、沐曦、天数的虚拟化、资源切分、强隔离、显存/算力配额;NVIDIA MIG 和 Ascend 官方 vNPU 强隔离适配 |
先拿厂商资料、客户卡型和现场环境,再评估 PoC |
| 明确不建议做项目定制 |
任意第三方 K8s 全生命周期接管、超出高效检索的跨集群自动调度/迁移/容灾切换、未获厂商确认的国产卡强隔离/超售、客户业务应用一致性容灾 |
研发、交付和责任边界过大 |
原始缺口口径
| 序号 |
原始缺口项 |
校准备注 |
| 1 |
资源配额管理 |
项目/任务维度为原始范围;扩展口径需和客户确认 |
| 2 |
漏洞修复 |
内核热补丁需相关平台确认;SKE 侧流程能力需单独界定 |
| 3 |
AI 算力虚拟化(NVIDIA) |
当前只支持 NVIDIA 卡 |
| 4 |
AI 算力虚拟化(国产卡) |
国产卡切分和共享能力为当前缺口 |
| 5 |
AI 算力虚拟化(强隔离) |
隔离强度需分软隔离、MIG、Ascend vNPU 等层级确认 |
| 6 |
AI 算力调度 |
需相关产品团队联合确认 |
| 7 |
跨集群应用管理 |
原始范围聚焦统一管理和检索 |
| 8 |
自定义资源 |
页面化 CRD/CR 管理需和客户确认 |
| 9 |
应用的扩缩容 |
原始范围按手动扩容校准 |
| 10 |
镜像清理 |
原始范围聚焦批量清理废弃镜像 |
| 11 |
资源监控 |
自监控面板需补齐 |
| 12 |
集群运维(容灾备份) |
需区分多层级恢复能力 |
| 13 |
账号与权限管理 |
K8s 原生 RBAC 与产品层权限模型需分开确认 |
| 14 |
统计报表 |
报表定制导出为原始范围 |
| 15 |
计量 |
计量为原始范围 |
| 16 |
高可用架构(待定) |
单 AZ、跨 AZ 容灾、RTO/RPO 按待定项记录 |
| 17 |
数据安全性(待定) |
训练场景要求,暂无规划 |
| 18 |
操作审计 |
需确认由 SKE、相关平台还是统一审计平台承载 |
缺口定制工作量初评
| 缺口 |
可定制范围 |
粗估工作量(约) |
不建议定制边界 |
| 容灾备份/高可用架构 |
管理面备份、K8s 对象备份、PV/PVC、应用一致性、单 AZ/跨 AZ(待定) |
管理面约45人天;K8s对象约60人天;PV/PVC约95人天;应用一致性约160人天 |
生产级应用一致性容灾、任意业务自动跨站点恢复 |
| 第三方 K8s 纳管 |
L1 只读纳管、L2 基础视图、L3 轻运维 |
研发约100人天,总计约220人天 |
第三方集群全生命周期接管 |
| 跨集群应用管理 |
统一检索、观测闭环 |
约210-270人天 |
跨集群自动调度、迁移、容灾 |
| AI 算力虚拟化与国产卡切分 |
Ascend 两套方案、沐曦、天数、海光 |
各方案约95-230人天 |
未获厂商确认的强隔离、超售 |
| AI 算力强隔离/NVIDIA MIG |
MIG 发现适配、展示、调度 |
约40-55人天 |
自研替代 MIG 方案 |
| AI 算力调度 |
训推共池、潮汐调度 |
约75-100人天 |
全局调度策略按产品评估 |
| 资源配额管理 |
项目/任务配额 |
约40-70人天 |
绕过相关平台单独做完整租户体系 |
| 统计报表与计量 |
报表定制导出、资源计量 |
约55-75人天 |
完整计费计价平台 |
| RBAC 授权模式(待定) |
产品层角色 |
约30-45人天 |
每个客户单独定制权限模型 |
| 自定义资源 CRD 管理(待定) |
页面化管理 |
约30-55人天 |
深度 UI 定制 |
| 应用负载弹性扩缩(待定) |
HPA 配置 |
约20人天 |
自研复杂弹性调度器 |
| 镜像清理 |
Harbor 批量清理 |
约20-25人天 |
非 Harbor 泛化纳管 |
| 漏洞修复与在线升级 |
CVE 流程 |
约45人天 |
OS/内核热补丁由平台统一处理 |
| 资源监控/自监控面板 |
指标采集、面板、健康视图 |
约70人天 |
黑盒、链路、日志扩展能力 |
| 数据安全性(待定) |
隔离策略 |
约35-90人天 |
按产品规划或安全专项评估 |
| 操作审计 |
审计事件采集和查询 |
约50人天 |
跨系统统一审计中心 |
全量工作量汇总
| 特性 |
总人天(约) |
说明 |
| 容灾备份/高可用架构 |
约785人天 |
含待定小项约400人天 |
| 第三方 K8s 纳管 |
约220人天 |
L1/L2/L3 |
| 跨集群应用管理 |
约270人天 |
含二期策略检查 |
| AI 算力虚拟化与国产卡切分 |
约685人天 |
含所有国产卡方案 |
| AI 算力强隔离/NVIDIA MIG |
约135人天 |
MIG 适配 |
| AI 算力调度 |
约335人天 |
训推共池、潮汐调度 |
| 资源配额管理 |
约195人天 |
项目/任务维度 |
| 统计报表与计量 |
约245人天 |
报表导出、资源计量 |
| RBAC 授权模式(待定) |
约100人天 |
待确认客户诉求 |
| 自定义资源 CRD 管理(待定) |
约115人天 |
待确认客户诉求 |
| 应用负载弹性扩缩(待定) |
约85人天 |
待确认自动扩缩需求 |
| 镜像清理 |
约110人天 |
Harbor 范围 |
| 漏洞修复与在线升级 |
约75人天 |
SKE 流程侧 |
| 资源监控/自监控面板 |
约155人天 |
基础能力 |
| 数据安全性(待定) |
约245人天 |
按安全专项估算 |
| 操作审计 |
约155人天 |
含跨系统归一 |
可回复一线的建议口径
初步将缺口拆成四类:现有能力可覆盖、可项目定制、需产品版本规划、明确不建议定制。第三方 K8s 纳管含 L1/L2/L3,按当前拆分为研发约100人天、测试支撑约45人天、测试执行约75人天,总计约220人天。跨集群高效检索、Harbor 批量清理适合项目定制。K8s 集群/应用级备份、AI 算力虚拟化等更适合按产品版本评估。
产线复核问题清单
| 复核对象 |
核心问题 |
| SKE |
第三方 K8s 纳管、跨集群检索、镜像清理、自监控等的工作量 |
| HCI/存储 |
VM 级、存储快照、PV/PVC 数据保护、跨站点容灾现有能力 |
| 相关产品平台 |
用户、租户、项目、配额、审计的统一对象模型 |
| AI 平台 |
训推共池、潮汐调度、GPU 时长、数据访问控制 |
| 组件中台/OS |
用户集群升级补丁包、在线升级、OS/内核热补丁 |
| 硬件技术团队 |
Ascend、海光、沐曦、天数、NVIDIA MIG 的卡型和原厂资料 |
关联分析文档