← 返回关联分析文档

光大银行 SKE 缺口定制工作量与不定制边界评估

ID: anl-everbright-customization | 更新于 2026-07-24
active 金融 银行 SKE 定制评估 客户分析

分析置信度

high

关联实体 (2)

光大银行 customer

光大银行 SKE 缺口定制工作量与不定制边界评估

结论

一线提出的问题可以拆成两件事:

  1. 产线复核每个缺口如果做定制,大致需要多少人天。
  2. 明确哪些内容适合作为项目定制,哪些内容需要进入产品路线图,哪些内容应直接排除项目定制承诺。

当前建议口径:

类型 能力范围 建议
可进入项目定制评估 第三方 K8s 只读/轻管理纳管、跨集群统一检索、跨集群基础观测入口、Harbor 批量清理废弃镜像、应用负载手动弹性扩缩、部分产品层 RBAC/CRD 管理(待定) 适合让产线评估工作量,可沉淀为 SKE 产品能力
适合产品版本规划 K8s 集群/应用级备份、高可用架构(待定)、跨集群策略下发、跨集群应用分发、资源配额管理、统计报表与计量、AI 算力虚拟化、AI 算力调度、自监控面板、数据安全性(待定)、操作审计 需要跨团队设计和版本节奏,不宜仅作为一次性项目定制
需要厂商/硬件前置确认 海光、沐曦、天数的虚拟化、资源切分、强隔离、显存/算力配额;NVIDIA MIG 和 Ascend 官方 vNPU 强隔离适配 先拿厂商资料、客户卡型和现场环境,再评估 PoC
明确不建议做项目定制 任意第三方 K8s 全生命周期接管、超出高效检索的跨集群自动调度/迁移/容灾切换、未获厂商确认的国产卡强隔离/超售、客户业务应用一致性容灾 研发、交付和责任边界过大

原始缺口口径

序号 原始缺口项 校准备注
1 资源配额管理 项目/任务维度为原始范围;扩展口径需和客户确认
2 漏洞修复 内核热补丁需相关平台确认;SKE 侧流程能力需单独界定
3 AI 算力虚拟化(NVIDIA) 当前只支持 NVIDIA 卡
4 AI 算力虚拟化(国产卡) 国产卡切分和共享能力为当前缺口
5 AI 算力虚拟化(强隔离) 隔离强度需分软隔离、MIG、Ascend vNPU 等层级确认
6 AI 算力调度 需相关产品团队联合确认
7 跨集群应用管理 原始范围聚焦统一管理和检索
8 自定义资源 页面化 CRD/CR 管理需和客户确认
9 应用的扩缩容 原始范围按手动扩容校准
10 镜像清理 原始范围聚焦批量清理废弃镜像
11 资源监控 自监控面板需补齐
12 集群运维(容灾备份) 需区分多层级恢复能力
13 账号与权限管理 K8s 原生 RBAC 与产品层权限模型需分开确认
14 统计报表 报表定制导出为原始范围
15 计量 计量为原始范围
16 高可用架构(待定) 单 AZ、跨 AZ 容灾、RTO/RPO 按待定项记录
17 数据安全性(待定) 训练场景要求,暂无规划
18 操作审计 需确认由 SKE、相关平台还是统一审计平台承载

缺口定制工作量初评

缺口 可定制范围 粗估工作量(约) 不建议定制边界
容灾备份/高可用架构 管理面备份、K8s 对象备份、PV/PVC、应用一致性、单 AZ/跨 AZ(待定) 管理面约45人天;K8s对象约60人天;PV/PVC约95人天;应用一致性约160人天 生产级应用一致性容灾、任意业务自动跨站点恢复
第三方 K8s 纳管 L1 只读纳管、L2 基础视图、L3 轻运维 研发约100人天,总计约220人天 第三方集群全生命周期接管
跨集群应用管理 统一检索、观测闭环 约210-270人天 跨集群自动调度、迁移、容灾
AI 算力虚拟化与国产卡切分 Ascend 两套方案、沐曦、天数、海光 各方案约95-230人天 未获厂商确认的强隔离、超售
AI 算力强隔离/NVIDIA MIG MIG 发现适配、展示、调度 约40-55人天 自研替代 MIG 方案
AI 算力调度 训推共池、潮汐调度 约75-100人天 全局调度策略按产品评估
资源配额管理 项目/任务配额 约40-70人天 绕过相关平台单独做完整租户体系
统计报表与计量 报表定制导出、资源计量 约55-75人天 完整计费计价平台
RBAC 授权模式(待定) 产品层角色 约30-45人天 每个客户单独定制权限模型
自定义资源 CRD 管理(待定) 页面化管理 约30-55人天 深度 UI 定制
应用负载弹性扩缩(待定) HPA 配置 约20人天 自研复杂弹性调度器
镜像清理 Harbor 批量清理 约20-25人天 非 Harbor 泛化纳管
漏洞修复与在线升级 CVE 流程 约45人天 OS/内核热补丁由平台统一处理
资源监控/自监控面板 指标采集、面板、健康视图 约70人天 黑盒、链路、日志扩展能力
数据安全性(待定) 隔离策略 约35-90人天 按产品规划或安全专项评估
操作审计 审计事件采集和查询 约50人天 跨系统统一审计中心

全量工作量汇总

特性 总人天(约) 说明
容灾备份/高可用架构 约785人天 含待定小项约400人天
第三方 K8s 纳管 约220人天 L1/L2/L3
跨集群应用管理 约270人天 含二期策略检查
AI 算力虚拟化与国产卡切分 约685人天 含所有国产卡方案
AI 算力强隔离/NVIDIA MIG 约135人天 MIG 适配
AI 算力调度 约335人天 训推共池、潮汐调度
资源配额管理 约195人天 项目/任务维度
统计报表与计量 约245人天 报表导出、资源计量
RBAC 授权模式(待定) 约100人天 待确认客户诉求
自定义资源 CRD 管理(待定) 约115人天 待确认客户诉求
应用负载弹性扩缩(待定) 约85人天 待确认自动扩缩需求
镜像清理 约110人天 Harbor 范围
漏洞修复与在线升级 约75人天 SKE 流程侧
资源监控/自监控面板 约155人天 基础能力
数据安全性(待定) 约245人天 按安全专项估算
操作审计 约155人天 含跨系统归一

可回复一线的建议口径

初步将缺口拆成四类:现有能力可覆盖、可项目定制、需产品版本规划、明确不建议定制。第三方 K8s 纳管含 L1/L2/L3,按当前拆分为研发约100人天、测试支撑约45人天、测试执行约75人天,总计约220人天。跨集群高效检索、Harbor 批量清理适合项目定制。K8s 集群/应用级备份、AI 算力虚拟化等更适合按产品版本评估。

产线复核问题清单

复核对象 核心问题
SKE 第三方 K8s 纳管、跨集群检索、镜像清理、自监控等的工作量
HCI/存储 VM 级、存储快照、PV/PVC 数据保护、跨站点容灾现有能力
相关产品平台 用户、租户、项目、配额、审计的统一对象模型
AI 平台 训推共池、潮汐调度、GPU 时长、数据访问控制
组件中台/OS 用户集群升级补丁包、在线升级、OS/内核热补丁
硬件技术团队 Ascend、海光、沐曦、天数、NVIDIA MIG 的卡型和原厂资料

关联分析文档