Online Resume
王虎虎
Mumong Wang
云原生平台工程出身,聚焦 LLM Agent 应用工程化。擅长通过任务编排、上下文管理、工具调用、执行追踪与评测闭环,提升 Agent 应用在真实运维场景中的稳定性和可迭代性。
核心能力
工作经历
云平台研发工程师(云原生 / Agent 开发方向)
- 围绕云原生平台与 AIOps Agent 落地,建设可观测数据底座,设计 Agent 四节点诊断链路与快速查询链路。
- 参与 AI Infra 工具调研部署,围绕 Kubeflow、Volcano / Ray、vLLM / LMDeploy 完成部署验证和文档沉淀。
- 将 AI Coding 用作工程质量控制手段,把需求拆解、代码审查和 badcase 复盘固化到目标开发流程中。
Selected Work
项目经历
简历默认只放结果和职责;需要细节时展开。
AIOps Agent 工程化实践 Agent 工程化 / 智能运维 Details
FastAPI · LangGraph · MCP · Pydantic · Kubernetes · Prometheus · Langfuse
- 设计并实现 Kubernetes 智能运维 Agent Demo,支持问题查询、证据收集、根因标签判断和结构化报告输出。
- 将诊断拆解为 Layer / Evidence / RCA / Conclusion 四阶段工作流,用结构化 handoff 降低长上下文下的跑偏风险。
- 构建 Pod 异常 E2E 评测体系,代表性 clean case 完成 450 次成功运行,根因标签命中率 94.7%,Runbook 覆盖率 99.6%。
扩展细节:通过 MCP 解耦 Kubernetes、Prometheus、Helm、日志等能力;设计 ObservationProcessor,把工具输出拆成 raw / structured / summary 三类产物,`kubectl_describe` 等重型输出最高压缩约 95%,同时保留审计回看能力。针对本地 32B 小模型的上下文漂移和 JSON 输出不稳定,使用 Pydantic schema、节点边界和代码逻辑控制诊断流程。
云原生可观测平台与 Agent 数据底座 可观测 / Evidence 构建 Details
Helm Chart · Prometheus · EFK · DeepFlow · kube-state-metrics · Langfuse
- 参与一体化可观测平台建设,覆盖指标、日志、调用链和 AI 业务可观测性,支撑云平台多维运行状态分析。
- 基于 Helm Chart 二次适配 Prometheus、EFK、DeepFlow 和内部组件,为 AIOps Agent 提供可验证 Evidence。
扩展细节:把单指标监控升级为 metrics + logs + traces + AI observability 的统一观测体系;针对 InfluxDB 监控查询耗时问题做链路分析,梳理查询优化方向,为监控 API 和 Agent 查询能力提供依据。
云管平台统一监控查询 API 平台 API / 多集群指标查询 Details
Go · Prometheus · Telegraf · InfluxDB · Cluster Label
- 开发统一监控查询 API,提供 CPU、内存、存储、网络流量等核心指标的多集群、多时间维度查询能力。
- 通过 Telegraf Cluster Label 支持多集群过滤、聚合和结构化返回,降低前端对底层存储差异的感知成本。
扩展细节:该接口同时面向监控大屏、运维排查和后续 Agent 工具化接入,目标是把分散在不同集群中的 Prometheus 监控数据抽象为统一平台能力。
AI 云平台工具链集成 AI Infra / 调研部署 Details
Kubeflow · Volcano · Ray · vLLM · LMDeploy · Kubernetes
- 调研并验证 Kubeflow、Volcano、Ray、vLLM、LMDeploy 等组件,覆盖训练流水线、批量调度、分布式计算和推理服务部署。
- 沉淀部署验证和技术文档,为 AI 云平台原型和后续平台化集成提供依据。
扩展细节:Kubeflow 关注训练任务编排和平台化接入;Volcano / Ray 关注 Queue、PodGroup、Gang Scheduling、多租户和资源管理;vLLM / LMDeploy 关注模型服务化、显存约束、吞吐与部署形态。
教育经历
技能栈
AI / Agent LangGraph、LangChain、Langfuse、MCP、HolmesGPT、Codex、Claude Code
工程栈 Go、Python、Shell、Kubernetes、Docker、Prometheus、EFK、InfluxDB、Harbor
AI Infra Kubeflow、Volcano、Ray、vLLM、LMDeploy;了解训练流水线、批量调度、推理服务部署
Appendix
过往经历与补充
DevOps 实习生
维护车联网服务构建流水线,排查构建失败、服务异常和环境配置问题;配置 Nginx 双向认证与容器化测试代理。
云计算开发实习生
参与云平台产品部署开发、自动化脚本、多操作系统适配、Kubernetes 排障和技术支持;基于 AWS CloudFormation 实现 TDC 云上一键启动方案。
补充项目
- 参与 Kubernetes 异构资源调度器 Demo,调研 Dijkstra、Floyd 等图搜索算法并实现核心调度模块。
- 参与云平台安全体系建设,调研 RBAC、Kata/gVisor、SBOM、签名审计、漏洞扫描和 SLSA 供应链安全实践。