月内到岗 · 山西临汾

培华

Linux 运维 / SRE 运维 / DevOps 运维工程师

27 岁 · 男 · 6 年一线运维经验。专注于多云稳定性保障、Kubernetes 生产集群、可观测体系与 CI/CD 自动化,擅长把复杂系统跑稳、跑省、跑顺。

peihua@resume — zsh
$ whoami guo_peihua — DevOps / SRE Engineer $ stack --top 多云运维 🐳 K8s / Docker 📊 Prometheus 🔁 CI/CD · GitOps 🛡 JumpServer Ansible / Shell $ status --availability ✓ 月内到岗 · 2016–2020 计科本科 # 把系统跑稳、跑省、跑顺
01

求职意向

意向岗位
Linux 运维 / SRE 运维 / DevOps 运维
目前状态
月内到岗
经验年限
约 5 年 · 百度 / 高灯科技
02

个人技能

云平台

阿里云腾讯云华为云百度云Google Cloud

🐳容器与编排

Dockerdocker-composeDockerfile私有镜像仓库KubernetesKubeSphere

📊监控告警

PrometheusPromQLAlertmanagerGrafanaWebhook 告警

📝日志平台

ELKBeatsFluentdKibana

🔁CI/CD · GitOps

GitLabJenkinsArgoCDNexusKustomizeHelm

🧩中间件

NginxRedisRabbitMQKafkaHAProxyKeepalivedZooKeeper

🗄数据库

MySQLMariaDB 主从TiDBClickHouse

🌐网关 · 安全

APISIXIngress-NginxJumpServer 堡垒机

📡大数据

AmbariHadoop/HDFSFlinkStreamX

自动化

ShellAnsiblepssh

💻编程语言

Python / DjangoGo / GinVue3 / Element Plus

🛠能力标签

多云资源运维K8s 高可用集群SLA 稳定性保障成本优化安全加固故障复盘运维知识库
03

工作经历

百度运维工程师 2022.06 — 至今
隶属:软通动力 · SaaS 公有云平台稳定性保障
  • 负责 ToC 官方平台国内、海外多环境的全生命周期服务管理,涵盖部署上线、版本升级、弹性扩缩容、故障排查与性能调优,保障 7×24 稳定运行。
  • 基于 Prometheus + Grafana + 自研 Webhook 构建精细化监控告警体系,覆盖 CPU、内存、GPU 等核心资源,实现异常秒级感知。
  • 制定并落地标准化上线与故障排查流程,显著缩短 MTTR,持续提升系统 SLA 稳定性指标。
  • 主导业务系统容器化改造与 K8s 集群管理,推动多环境(开发/测试/预发/生产)标准化部署,提升交付效率与环境一致性。
  • 公有云费用结构梳理与成本优化,迁移/释放闲置 GPU、CPU 实例、负载均衡、对象存储、CFS 等资源。
  • 跟进安全漏洞通告,完成漏洞修复与加固,输出运维安全报告,确保平台合规运行。
  • 定期编写运维报告,梳理运行状态、故障复盘与改进措施,沉淀运维知识库。
高灯科技运维工程师 2021.08 — 2022.04
生产环境微服务与小程序运维
  • 负责生产环境的小程序、微服务版本热修复与紧急需求发版
  • 负责基于 K8s 的搭建与日常维护工作。
  • 负责服务器日常巡检,持续提升可用性与效率。
  • 使用 Shell、Python 完成日常繁琐的自动化工作。
  • 负责线上告警后的突发性故障处理与应急响应。
04

项目经历

福建高速长隧道群数字孪生系统

// 交通智能感知 · 三维可视化

隧道运行状态及突发事件智能检测:融合前端摄像机、毫米波雷达、AI 视觉感知、雷视融合、三维建模与高精地图,实现全天候、精细化交通监测与全景三维呈现。

  • 基于 Docker 与 kubeadm 搭建高可用 K8s 集群(3 master + 6 worker)。
  • 部署 MQTT、Kafka、Redis、MinIO、JumpServer 及 Prometheus + Grafana 监控。
  • 使用 KubeSphere 管理 Deployment,Jenkins 流水线自动化部署前后端业务。
  • 搭建 Ambari / StreamX / HDFS / Flink / ClickHouse 大数据组件。
  • Python 编写脚本采集高速相机图片,用于交通事件检测模型训练。
KubernetesKafkaPrometheusFlinkPython

Keevx 数字人出海项目

// 海外 GCP 迁移 · SRE

将国内业务架构迁移至美国 Google Cloud 集群,面向海外 C 端用户提供稳定的数字人服务,保障海外环境的 SLA 与发布稳定性。

  • 基于 GCP(LB / Cloud SQL / GCS / GCE / GKE / Looker / BigQuery)复用国内架构,最小改动落地海外集群。
  • 搭建 kube-prometheus + Alertmanager + Grafana 监控,建立标准化上线与故障处理流程。
  • 利用 iCode + ArgoCD 搭建 OpsCD 流水线,实现自动化构建、测试与部署。
  • 部署 FELK(Fluentd+ES+Kafka+Logstash+Kibana)日志系统,统一收集分析集群日志。
  • 为国内研发/测试团队提供稳定的科学上网节点,保障顺畅访问海外环境。
Google CloudGKEArgoCDFELKBigQuery

内部 CI/CD 平台建设

// 多环境发布 · 灰度

面向 test / gamma / prod 环境的内部 CI/CD 平台,支持 Java 8/17/21 版本迭代管理与灰度发布,通过精细化版本控制降低发布风险。

  • 安装 Nexus 并配置缓存仓库组,加速 Maven 依赖解析。
  • 编写多 JDK 版本基础镜像 Dockerfile 及 Jenkins Slave 基础镜像。
  • 基于 Django 采集 K8s 集群服务信息,对外提供 API 接口。
  • Jenkins 通过 K8s 调度实现临时 Slave 节点动态分配。
  • 基于 Shared Libraries + Groovy 声明式 Pipeline,结合 LDAP 与角色插件做精细化权限。
  • 使用 Kustomize & Helm 管理多环境 Deployment 配置。
JenkinsNexusHelmDjangoK8s

集成告警平台微服务

// 智能告警 · 电话通知

接收 Alertmanager 告警,经规则中心智能过滤、存储低级别告警并通过 Webhook 分发;对灾难级告警触发自动电话通知,确保紧急事件及时响应。

  • 基于 Django 开发 Webhook 接口,高效接收并处理 Alertmanager 监控数据。
  • 提取并格式化关键信息,将告警以清晰形式推送至群消息。
  • 调用 CMDB 告警中心路由规则,实现告警精准匹配与分发。
  • 集成云语音服务,自动触发电话通知,保障重大告警快速响应。
DjangoAlertmanagerWebhookCMDB
05

教育经历

2016 — 2020
山西工商学院
计算机科学与技术 · 本科