Skip to content
mumong's blog

Online Resume

王虎虎

Mumong Wang

Agent 开发工程师 / 大模型应用工程师 北京 · 硕士学历

云原生平台工程出身,聚焦 LLM Agent 应用工程化。擅长通过任务编排、上下文管理、工具调用、执行追踪与评测闭环,提升 Agent 应用在真实运维场景中的稳定性和可迭代性。

核心能力

Agent 工程化 LangGraph Workflow、MCP Tool Use、结构化 Handoff、Pydantic 输出约束、兜底逻辑。
上下文工程 Prompt 缓存、工具输出压缩、状态摘要、输入裁剪,适配本地小模型长上下文限制。
云原生 / 可观测 Kubernetes、Helm、Prometheus、EFK、DeepFlow、InfluxDB、Langfuse。
AI Coding 使用 Codex / Claude Code 结合 speckit、superpowers 做需求拆解、SDD、Review 和 badcase 复盘。

工作经历

某云原生与通信技术研究机构

云平台研发工程师(云原生 / Agent 开发方向)

  • 围绕云原生平台与 AIOps Agent 落地,建设可观测数据底座,设计 Agent 四节点诊断链路与快速查询链路。
  • 参与 AI Infra 工具调研部署,围绕 Kubeflow、Volcano / Ray、vLLM / LMDeploy 完成部署验证和文档沉淀。
  • 将 AI Coding 用作工程质量控制手段,把需求拆解、代码审查和 badcase 复盘固化到目标开发流程中。

Selected Work

项目经历

简历默认只放结果和职责;需要细节时展开。

AIOps Agent 工程化实践 Agent 工程化 / 智能运维 Details

FastAPI · LangGraph · MCP · Pydantic · Kubernetes · Prometheus · Langfuse

  • 设计并实现 Kubernetes 智能运维 Agent Demo,支持问题查询、证据收集、根因标签判断和结构化报告输出。
  • 将诊断拆解为 Layer / Evidence / RCA / Conclusion 四阶段工作流,用结构化 handoff 降低长上下文下的跑偏风险。
  • 构建 Pod 异常 E2E 评测体系,代表性 clean case 完成 450 次成功运行,根因标签命中率 94.7%,Runbook 覆盖率 99.6%。

扩展细节:通过 MCP 解耦 Kubernetes、Prometheus、Helm、日志等能力;设计 ObservationProcessor,把工具输出拆成 raw / structured / summary 三类产物,`kubectl_describe` 等重型输出最高压缩约 95%,同时保留审计回看能力。针对本地 32B 小模型的上下文漂移和 JSON 输出不稳定,使用 Pydantic schema、节点边界和代码逻辑控制诊断流程。

云原生可观测平台与 Agent 数据底座 可观测 / Evidence 构建 Details

Helm Chart · Prometheus · EFK · DeepFlow · kube-state-metrics · Langfuse

  • 参与一体化可观测平台建设,覆盖指标、日志、调用链和 AI 业务可观测性,支撑云平台多维运行状态分析。
  • 基于 Helm Chart 二次适配 Prometheus、EFK、DeepFlow 和内部组件,为 AIOps Agent 提供可验证 Evidence。

扩展细节:把单指标监控升级为 metrics + logs + traces + AI observability 的统一观测体系;针对 InfluxDB 监控查询耗时问题做链路分析,梳理查询优化方向,为监控 API 和 Agent 查询能力提供依据。

云管平台统一监控查询 API 平台 API / 多集群指标查询 Details

Go · Prometheus · Telegraf · InfluxDB · Cluster Label

  • 开发统一监控查询 API,提供 CPU、内存、存储、网络流量等核心指标的多集群、多时间维度查询能力。
  • 通过 Telegraf Cluster Label 支持多集群过滤、聚合和结构化返回,降低前端对底层存储差异的感知成本。

扩展细节:该接口同时面向监控大屏、运维排查和后续 Agent 工具化接入,目标是把分散在不同集群中的 Prometheus 监控数据抽象为统一平台能力。

AI 云平台工具链集成 AI Infra / 调研部署 Details

Kubeflow · Volcano · Ray · vLLM · LMDeploy · Kubernetes

  • 调研并验证 Kubeflow、Volcano、Ray、vLLM、LMDeploy 等组件,覆盖训练流水线、批量调度、分布式计算和推理服务部署。
  • 沉淀部署验证和技术文档,为 AI 云平台原型和后续平台化集成提供依据。

扩展细节:Kubeflow 关注训练任务编排和平台化接入;Volcano / Ray 关注 Queue、PodGroup、Gang Scheduling、多租户和资源管理;vLLM / LMDeploy 关注模型服务化、显存约束、吞吐与部署形态。

教育经历

上海师范大学 硕士,电子信息
西南交通大学(211) 本科,电子信息科学与技术

技能栈

AI / Agent LangGraph、LangChain、Langfuse、MCP、HolmesGPT、Codex、Claude Code

工程栈 Go、Python、Shell、Kubernetes、Docker、Prometheus、EFK、InfluxDB、Harbor

AI Infra Kubeflow、Volcano、Ray、vLLM、LMDeploy;了解训练流水线、批量调度、推理服务部署

Appendix

过往经历与补充

某数字化咨询公司

DevOps 实习生

维护车联网服务构建流水线,排查构建失败、服务异常和环境配置问题;配置 Nginx 双向认证与容器化测试代理。

某云计算与大数据平台公司

云计算开发实习生

参与云平台产品部署开发、自动化脚本、多操作系统适配、Kubernetes 排障和技术支持;基于 AWS CloudFormation 实现 TDC 云上一键启动方案。

补充项目

  • 参与 Kubernetes 异构资源调度器 Demo,调研 Dijkstra、Floyd 等图搜索算法并实现核心调度模块。
  • 参与云平台安全体系建设,调研 RBAC、Kata/gVisor、SBOM、签名审计、漏洞扫描和 SLSA 供应链安全实践。