K8s集群管理专业版
企业级Kubernetes管理平台,支持多集群统一管理、策略治理、监控告警、GitOps自动化及完整CRD生命周期管理。
天轰穿
@thcjp
Install
$ openclaw skills install @thcjp/kubernetes-toolkit-pro功能说明: 本技能涵盖 中文交互、化工作流场景 等核心能力。
K8s集群管理专业版(PRO版)
概述
本平台为企业运维团队提供全功能的K8s管理能力。相比免费版,PRO版新增多集群管理、策略治理、监控告警、GitOps自动化和CRD完整管理等高级功能,全面满足企业级K8s运维的复杂需求. PRO版完全兼容免费版单集群管理命令,升级后原有管理工作流可直接使用.
核心能力
PRO版功能增强对比
| 功能 | 免费版 | PRO版 |
|---|---|---|
| 集群数量 | 单集群 | 多集群统一 |
| 策略治理 | 不支持 | OPA/Kyverno |
| 监控告警 | 不支持 | 全维度监控 |
| GitOps | 不支持 | ArgoCD/Flux |
| CRD管理 | 基础查询 | 完整生命周期 |
| Agent调度 | 固定分配 | 智能调度 |
| 资源优化 | 不支持 | 成本优化 |
| 灾备迁移 | 不支持 | 跨集群灾备 |
处理: 解析PRO版功能增强对比的输入参数,完成核心逻辑,返回结构化响应. 输出: 返回PRO版功能增强对比的响应数据,包含状态码、结果和日志.
核心功能执行
用input_params参数进行配置.
处理: 解析核心功能执行的输入参数,完成核心逻辑,返回结构化响应. 输出: 返回核心功能执行的响应数据,包含状态码、结果和日志.
- 执行此能力时使用
input_params参数,支持创建/查询/导出操作
参数配置与调用
用config_options参数进行配置.
处理: 解析参数配置与调用的输入参数,完成核心逻辑,返回结构化响应. 输出: 返回参数配置与调用的响应数据,包含状态码、结果和日志.
- 执行此能力时使用
config_options参数,支持修改/重置/导入操作 能力覆盖范围:本skill的核心能力覆盖以下场景关键词:企业级、管理平台、支持多集群、监控告警与、自动化、面向企业运维团队、全功能管理平台、支持多集群统一管、自动化与、完整管理、Use、when、需要系统监控、日志分析、运维告警、部署管理时使用、不适用于物理硬件、适用于独立开发者、企业团队和自动化、工作流场景等。这些关键词对应description中声明的使用场景,均已在上述能力点中提供对应的操作支持.
使用场景
场景一:多集群统一管理
用户输入:"查看所有集群的状态"
# 多集群状态概览
python3 (请参考skill目录中的脚本文件) clusters status --all
# ...
# 输出:
# === 集群状态总览 ===
# prod-cluster 5节点 120Pods CPU:35% MEM:45% [健康]
# staging-cluster 3节点 60Pods CPU:20% MEM:30% [健康]
# dev-cluster 2节点 30Pods CPU:15% MEM:25% [健康]
# ...
# 跨集群资源对比
python3 (请参考skill目录中的脚本文件) clusters compare --resource deployments
场景二:策略治理
用户输入:"确保所有Pod都设置了资源限制"
# 创建策略
python3 (请参考skill目录中的脚本文件) policy create \
--name "require-resource-limits" \
--engine "kyverno" \
--rule "所有Pod必须设置resources.limits" \
--enforce
# ...
# 检查合规性
python3 (请参考skill目录中的脚本文件) policy check --cluster production
# ...
# 输出不合规资源列表
场景三:GitOps部署
用户输入:"通过GitOps部署应用"
# 配置GitOps
python3 (请参考skill目录中的脚本文件) gitops setup \
--engine "argocd" \
--repo "https://git.example.com/k8s-manifests" \
--cluster production
# ...
# 同步部署
python3 (请参考skill目录中的脚本文件) gitops sync --app my-app
# ...
# 查看同步状态
python3 (请参考skill目录中的脚本文件) gitops status --all
快速开始
- 阅读## 核心能力章节了解skill功能
- 按## 依赖说明配置环境
- 执行所需能力对应的命令
- 参考## 错误处理章节处理异常
- 查看## FAQ解答常见疑问
PRO版初始化
# 依赖说明
pip install -r requirements_pro.txt
# ...
# 配置多集群
cp config_pro_template.yaml config_pro.yaml
常用命令
# 多集群管理
python3 (请参考skill目录中的脚本文件) clusters list
python3 (请参考skill目录中的脚本文件) clusters status --all
python3 (请参考skill目录中的脚本文件) clusters deploy --template web-app --clusters "prod,staging"
# ...
# 策略治理
python3 (请参考skill目录中的脚本文件) policy create --name "require-limits" --engine kyverno --enforce
python3 (请参考skill目录中的脚本文件) policy check --cluster production
# ...
# GitOps
python3 (请参考skill目录中的脚本文件) gitops setup --engine argocd --repo "https://git.example.com/manifests"
python3 (请参考skill目录中的脚本文件) gitops sync --app my-app
# ...
# 监控
python3 (请参考skill目录中的脚本文件) monitor watch --cluster production
python3 (请参考skill目录中的脚本文件) monitor alerts --cluster production
# ...
# CRD管理
python3 (请参考skill目录中的脚本文件) crd list
python3 (请参考skill目录中的脚本文件) crd install --definition ./crd.yaml
响应解析: 完成完成后,查看输出响应确认任务状态。成功时输出包含解析摘要和响应数据;失败时根据错误信息排查问题,查阅错误解析章节获取恢复步骤.
示例
PRO企业级配置
pro_config:
clusters:
- name: "production"
kubeconfig: "$HOME/.kube/config-prod"
cloud: "aws"
region: "us-east-1"
- name: "staging"
kube/config-staging"
cloud: "azure"
region: "eastus"
- name: "development"
cloud: "on-premise"
# ...
policy:
engine: "kyverno" # kyverno | opa
policies:
- require_resource_limits
- disallow_latest_tag
- require_namespace_labels
- restrict_ingress
enforce: true # 强制模式
# ...
monitoring:
enabled: true
metrics_server: true
prometheus: true
grafana: true
alerts:
channels: ["webhook", "email"]
rules:
- pod_restart_count > 5
- node_cpu > 80%
- pvc_usage > 85%
# ...
gitops:
engine: "argocd" # argocd | flux
repo: "https://git.example.com/k8s-manifests"
auto_sync: true
auto_prune: true
self_heal: true
# ...
agents:
mode: "intelligent" # intelligent | fixed
max_agents: 20
scheduling: "balanced" # balanced | performance | cost
# ...
optimization:
resource_optimization: true
cost_analysis: true
right_sizing: true # 资源规格优化
# ...
disaster_recovery:
enabled: true
backup_schedule: "0 2 * * *"
cross_cluster: true
velero: true
优选实践
PRO版企业实践
| 实践领域 | 建议做法 |
|---|---|
| 多集群 | 统一配置基线,差异化环境策略 |
| 策略治理 | 先warn模式测试,再enforce强制 |
| GitOps | 所有变更通过Git提交,避免直接kubectl |
| 监控 | 关键指标设置告警,及时响应 |
| 灾备 | 定期演练灾备恢复流程 |
免费版兼容性
免费版命令 → PRO版命令(增强):
k8s.py deploy → k8s_pro.py clusters deploy --clusters "prod,staging"
k8s.py list → k8s_pro.py clusters compare
单集群管理 → 多集群统一+策略治理+GitOps
常见问题
Q1:支持多少个集群?
PRO版支持最多20个集群的统一管理。支持跨云(AWS/Azure/GCP)和混合云(含本地集群).
Q2:OPA和Kyverno选哪个?
Kyverno是K8s原生策略引擎,语法更简洁、易学;OPA Gatekeeper功能更强大、通用性好。建议K8s专属场景用Kyverno,需要跨平台策略用OPA.
Q3:GitOps如何工作?
所有K8s配置(YAML清单)存储在Git仓库中,ArgoCD/Flux自动同步Git仓库与集群状态。任何变更通过Git提交,自动部署到集群。实现声明式、可审计的部署流程.
Q4:多Agent智能调度如何工作?
PRO版根据集群负载、资源可用性和任务优先级,自动将管理任务分配给最合适的Agent。相比免费版的固定分配,提高资源利用率和响应速度.
Q5:灾备如何实现?
通过Velero备份集群资源和持久卷到对象存储(S3/Azure Blob)。支持跨集群恢复,实现灾备切换。备份策略可配置(每日/每周).
依赖说明
运行环境
- Agent平台: 支持SKILL.md的任意AI Agent(Claude Code / Cursor / Codex / Gemini CLI等)
- 操作系统: Windows / macOS / Linux
- Python版本: 3.9+
- kubectl: 已配置多集群访问
第三方依赖
| 依赖项 | 类型 | 是否必需 | 获取方式 |
|---|---|---|---|
| LLM API | API | 必需 | 由Agent内置LLM提供 |
| Python | 运行时 | 必需 | 系统安装或conda环境 |
| kubernetes | Python库 | 必需 | pip install kubernetes |
| PyYAML | Python库 | 必需 | pip install pyyaml |
| requests | Python库 | 可选 | pip install requests(API调用) |
| argocd | CLI工具 | 可选 | GitOps引擎 |
API Key 配置
| 服务 | 环境变量 | 是否必需 | 用途 |
|---|---|---|---|
| ArgoCD | ARGOCD_TOKEN | 可选 | GitOps集成 |
| Prometheus | PROMETHEUS_URL | 可选 | 监控集成 |
| Grafana | GRAFANA_API_KEY | 可选 | 仪表盘集成 |
- 通过kubeconfig管理多集群访问
- 各集群使用不同context区分
可用性分类
- 分类: MD+EXEC(Markdown指令+Python脚本+kubectl执行)
- 说明: 企业级K8s管理平台,支持多集群、策略治理与GitOps
- PRO版特性: 多集群、策略治理、监控告警、GitOps、CRD管理、智能调度、灾备
- 兼容性: 完全兼容免费版单集群管理命令
错误处理
| 错误场景 | 原因 | 处理方式 |
|---|---|---|
| 配置错误 | 参数缺失或格式错误 | 检查依赖说明中的配置要求 |
| 运行时错误 | 运行环境不满足 | 确认运行环境符合依赖说明 |
| 网络错误 | 连接超时或不可达 | 执行ping命令测试网络连通性,检查防火墙和代理设置连接后执行ping命令测试网络连通性,检查防火墙和代理设置连接后重新执行命令,参考国内替代方案 |
已知限制
- 需LLM支持,无LLM环境不可用
- 复杂业务场景建议结合人工经验判断
- 执行效率受模型能力与网络环境影响
安全注意事项
| 风险类型 | 防范措施 |
|---|---|
| API密钥泄露 | 通过环境变量配置,禁止硬编码到代码或配置文件中 |
| 命令执行风险 | 仅执行白名单命令,避免拼接用户输入到命令行参数中 |
| 网络通信安全 | 使用HTTPS协议,验证SSL证书有效性 |
| 敏感数据暴露 | 输出结果中不包含密钥、令牌等敏感信息 |
使用前请确认已阅读依赖说明章节,确保运行环境满足安全要求。
核心功能
- 自动化执行: 企业级K8s管理平台,支持多集群、策略治理、监控告警与GitOps自动化.。面向企业运维团队的K8s全功能管理平台。支持
- 文件处理: 支持多种文件格式的读取、解析和写入操作
- API集成: 通过标准化接口调用外部服务并处理响应
- 命令执行: 在安全沙箱中执行系统命令并收集结果
- 信息检索: 快速搜索和过滤目标数据
核心功能
- 自动化执行: 企业级K8s管理平台,支持多集群、策略治理、监控告警与GitOps自动化.。面向企业运维团队的K8s全功能管理平台。支持
- 文件处理: 支持多种文件格式的读取、解析和写入操作
- API集成: 通过标准化接口调用外部服务并处理响应
- 命令执行: 在安全沙箱中执行系统命令并收集结果
- 信息检索: 快速搜索和过滤目标数据
Top skills in this category
API Gateway
@byungkyuCall third-party APIs through the Maton gateway, which injects the credential for an app the user has already connected. Use this skill when the user names a connected app and a concrete action in it - read a mailbox, query a CRM, file an issue, update a spreadsheet, run a query through a connected
Marketing Mode
@thesethroseMarketing Mode combines 23 comprehensive marketing skills covering strategy, psychology, content, SEO, conversion optimization, and paid growth. Use when users need marketing strategy, copywriting, SEO help, conversion optimization, paid advertising, or any marketing tactic.
Blogwatcher
@steipeteMonitor blogs and RSS/Atom feeds for updates using the blogwatcher CLI.
Marketing Skills
@jchopard69Access 23 marketing modules offering checklists, frameworks, and ready-to-use deliverables for CRO, SEO, copywriting, analytics, launches, ads, and social me...
diagram-generator
@matthewyinGenerate and edit diagrams with the mcp-diagram-generator MCP server. Use this skill for new diagrams, existing .drawio/.mmd/.excalidraw edits, network topology, architecture, flowchart, swimlane, sequence, class, ER, and Excalidraw whiteboard work. Always use this skill when the user asks to draw,