eln-infra-ops

以代码复现自建 CI 服务器集群的公司内部基础设施。将合格判定置于实机 kill-test 而非设计文档之上,即使发生故障也保障不停机的可用性。

概述



以代码复现并运营自有 CI 服务器集群的公司内部基础设施。不依赖 SSH 手动操作,而是使用 Ansible、Docker Compose、Terraform / OpenTofu,将服务器初始设置到全部服务启动统一以代码管理。分发给各仓库的 CI workflow 模板也由本基础设施提供。

运营目标



针对 commander、Portal、DefectDojo、OpenSearch、监控(Grafana/Prometheus)、secrets、runners 在内的全部服务,目标是任意一个节点停止时,其余节点仍能不停机地继续运行(full-HA)。合格判定不依据设计文档,而是通过实机 kill-test 判定:停止一个节点,确认所有 endpoint 仍可响应、无数据丢失、不发生 split-brain。

主要功能

CI/CD 基础设施

提供 ×10 组织级 self-hosted runner(light/docker/security)、security-pr/main/scheduled workflow、Dependabot,以及与 DefectDojo 的漏洞台账联动。

可观测性(Observability)

由 Grafana、Loki、Prometheus、Alertmanager(Slack + 邮件通知)、Tempo + Alloy(OTel)、node_exporter、cAdvisor、Promtail 组成的监控基础设施。

全文检索与日志

通过 OpenSearch 与 Dashboards,实现基于 Vector 的日志采集(重要度采样)与 ISM retention。

安全扫描

将 Semgrep、Trivy、Gitleaks、CodeQL、Safe Chain 内置于 runner 镜像与 workflow 中。

AWS 日志基础设施

由 S3、Glue(partition projection)、Athena、IAM 构成,已验证从 Firehose 经 S3 到 Athena 的日志链路。

访问控制

通过 Cloudflare Access(GitHub 登录)控制对 graph、DefectDojo、kibana.eln.ne.jp 的访问(Grafana 为 JWT SSO,DefectDojo 为两层认证,Dashboards 仅 Access)。

状态:公司内部运营

查看其他产品

咨询 eln-infra-ops

如对导入或集成有任何疑问,欢迎随时联系我们。

eln-infra-ops