三亩地 三亩地SAN MU DI · CODE DIARY
ARTICLE DETAIL

日记详情

真实记录编程学习的某一天,欢迎挑你感兴趣的翻一翻。

Kubernetes集群部署与运维实战指南

Kubernetes集群部署与运维实战指南

1. 从零开始:Kubernetes集群部署前的关键准备

在真正动手部署Kubernetes集群之前,我们需要做好充分的准备工作。就像建造房屋需要打地基一样,合理的准备工作能避免后续80%的部署问题。根据我多年部署Kubernetes集群的经验,以下这些环节最容易被忽视但至关重要。

1.1 硬件资源规划与节点角色分配

一个生产可用的Kubernetes集群至少需要3个节点(1个Master + 2个Worker)。但实际部署中,我建议采用3个Master节点实现高可用,Worker节点根据业务需求动态扩展。以下是硬件配置的黄金法则:

  • Master节点:至少2核CPU/4GB内存/50GB磁盘(etcd数据目录单独挂载SSD)
  • Worker节点:根据容器负载调整,建议4核CPU起/8GB内存/100GB磁盘
  • 网络要求:节点间延迟<5ms,带宽≥1Gbps

特别注意:etcd对磁盘IOPS要求极高,使用云盘时务必选择高性能SSD。我曾遇到etcd因磁盘性能不足导致集群不可用的情况,更换为NVMe SSD后问题立即解决。

1.2 操作系统与内核参数调优

推荐使用CentOS 7.9+/Ubuntu 20.04 LTS作为宿主机系统。部署前必须完成以下系统配置:

# 关闭Swap(Kubernetes 1.8+强制要求) sudo swapoff -a sed -i '/ swap / s/^/#/' /etc/fstab # 加载内核模块 cat <<EOF | sudo tee /etc/modules-load.d/k8s.conf br_netfilter ip_vs ip_vs_rr ip_vs_wrr ip_vs_sh nf_conntrack EOF # 设置内核参数 cat <<EOF | sudo tee /etc/sysctl.d/k8s.conf net.bridge.bridge-nf-call-ip6tables = 1 net.bridge.bridge-nf-call-iptables = 1 net.ipv4.ip_forward = 1 vm.swappiness = 0 EOF sudo sysctl --system

1.3 容器运行时选择与配置

虽然Docker仍是常见选择,但根据Kubernetes官方建议,我更推荐使用containerd作为运行时:

# 安装containerd sudo apt-get update && sudo apt-get install -y containerd sudo mkdir -p /etc/containerd containerd config default | sudo tee /etc/containerd/config.toml sudo systemctl restart containerd # 配置cgroup驱动为systemd(必须与kubelet一致) sudo sed -i 's/SystemdCgroup = false/SystemdCgroup = true/' /etc/containerd/config.toml

2. 集群部署实战:kubeadm最佳实践

2.1 使用kubeadm初始化控制平面

以下命令将在第一个Master节点上初始化集群:

sudo kubeadm init \ --control-plane-endpoint "CLUSTER_API_ENDPOINT:6443" \ --upload-certs \ --pod-network-cidr=10.244.0.0/16 \ --service-cidr=10.96.0.0/12 \ --image-repository registry.aliyuncs.com/google_containers

关键参数说明:

  • --control-plane-endpoint:负载均衡器地址(生产环境必须配置)
  • --upload-certs:自动轮转证书
  • --image-repository:使用国内镜像源加速

初始化成功后,按照提示配置kubectl:

mkdir -p $HOME/.kube sudo cp -i /etc/kubernetes/admin.conf $HOME/.kube/config sudo chown $(id -u):$(id -g) $HOME/.kube/config

2.2 高可用控制平面部署

对于生产环境,需要添加额外的Master节点实现高可用:

kubeadm join 192.168.1.100:6443 \ --token <token> \ --discovery-token-ca-cert-hash sha256:<hash> \ --control-plane \ --certificate-key <key>

高可用架构建议:

  • 使用Keepalived + HAProxy实现API Server负载均衡
  • etcd集群配置为独立节点(非堆叠式)提升稳定性
  • 每个Master节点部署在不同可用区实现跨AZ容灾

2.3 工作节点加入集群

Worker节点加入命令与Master类似(去掉--control-plane参数):

kubeadm join 192.168.1.100:6443 \ --token <token> \ --discovery-token-ca-cert-hash sha256:<hash>

3. 网络插件选型与部署

3.1 Calico网络方案实践

Calico是生产环境最常用的CNI插件,提供高性能网络策略:

kubectl apply -f https://docs.projectcalico.org/manifests/calico.yaml

关键配置调优:

  • 启用IPIP模式跨子网通信
  • 配置IP地址池匹配pod-network-cidr
  • 启用eBPF加速模式(内核>=4.18)

3.2 网络策略实战示例

以下策略只允许frontend Pod访问backend服务的80端口:

apiVersion: networking.k8s.io/v1 kind: NetworkPolicy metadata: name: backend-allow-frontend spec: podSelector: matchLabels: app: backend ingress: - from: - podSelector: matchLabels: app: frontend ports: - protocol: TCP port: 80

4. 存储方案设计与实现

4.1 动态存储供应配置

以NFS为例创建StorageClass:

apiVersion: storage.k8s.io/v1 kind: StorageClass metadata: name: nfs-storage provisioner: example.com/nfs parameters: server: nfs-server.example.com path: /share

4.2 CSI驱动集成实践

以AWS EBS为例:

kubectl apply -k "github.com/kubernetes-sigs/aws-ebs-csi-driver/deploy/kubernetes/overlays/stable/?ref=master"

创建StorageClass:

apiVersion: storage.k8s.io/v1 kind: StorageClass metadata: name: ebs-sc provisioner: ebs.csi.aws.com volumeBindingMode: WaitForFirstConsumer

5. DevOps流水线集成

5.1 GitOps工作流实现

使用Argo CD部署应用:

kubectl create namespace argocd kubectl apply -n argocd -f https://raw.githubusercontent.com/argoproj/argo-cd/stable/manifests/install.yaml

配置自动同步:

apiVersion: argoproj.io/v1alpha1 kind: Application metadata: name: myapp spec: destination: server: https://kubernetes.default.svc namespace: default source: repoURL: https://github.com/example/myapp.git targetRevision: HEAD path: k8s syncPolicy: automated: selfHeal: true prune: true

5.2 Tekton CI/CD流水线示例

定义构建任务:

apiVersion: tekton.dev/v1beta1 kind: Task metadata: name: build-push spec: steps: - name: build image: maven:3.6.0-jdk-11 command: ["mvn", "clean", "package"] - name: build-image image: gcr.io/kaniko-project/executor:latest args: [ "--dockerfile=Dockerfile", "--context=.", "--destination=gcr.io/myproject/myimage:latest" ]

6. 监控与日志方案

6.1 Prometheus-Operator部署

使用kube-prometheus-stack:

helm repo add prometheus-community https://prometheus-community.github.io/helm-charts helm install kube-prometheus-stack prometheus-community/kube-prometheus-stack \ --namespace monitoring \ --create-namespace

6.2 EFK日志收集方案

部署Elasticsearch+Fluentd+Kibana:

helm install elasticsearch elastic/elasticsearch \ --namespace logging \ --create-namespace helm install fluentd fluent/fluentd \ --namespace logging \ --set elasticsearch.host=elasticsearch-master.logging.svc.cluster.local helm install kibana elastic/kibana \ --namespace logging \ --set service.type=NodePort

7. 安全加固实践

7.1 RBAC权限控制

创建最小权限ServiceAccount:

apiVersion: v1 kind: ServiceAccount metadata: name: ci-deployer --- apiVersion: rbac.authorization.k8s.io/v1 kind: Role metadata: name: deployer-role rules: - apiGroups: ["apps"] resources: ["deployments"] verbs: ["get", "list", "watch", "create", "update", "patch"] --- apiVersion: rbac.authorization.k8s.io/v1 kind: RoleBinding metadata: name: deployer-binding subjects: - kind: ServiceAccount name: ci-deployer roleRef: kind: Role name: deployer-role

7.2 Pod安全策略

使用PodSecurityPolicy限制特权容器:

apiVersion: policy/v1beta1 kind: PodSecurityPolicy metadata: name: restricted spec: privileged: false allowPrivilegeEscalation: false requiredDropCapabilities: - ALL volumes: - 'configMap' - 'emptyDir' - 'secret' hostNetwork: false hostIPC: false hostPID: false runAsUser: rule: 'MustRunAsNonRoot'

8. 生产环境运维技巧

8.1 集群升级策略

使用kubeadm进行原地升级:

# 升级控制平面 sudo apt-get update && sudo apt-get install -y kubeadm=1.22.5-00 sudo kubeadm upgrade plan sudo kubeadm upgrade apply v1.22.5 # 升级节点 sudo apt-get update && sudo apt-get install -y kubelet=1.22.5-00 kubectl=1.22.5-00 sudo systemctl daemon-reload sudo systemctl restart kubelet

8.2 故障排查命令大全

常用诊断命令:

# 查看节点状态 kubectl get nodes -o wide # 检查Pod事件 kubectl describe pod <pod-name> # 查看容器日志 kubectl logs -f <pod-name> -c <container-name> # 网络连通性测试 kubectl run -it --rm --restart=Never test-pod --image=busybox -- sh # API健康检查 curl -k https://localhost:6443/healthz

在实际生产运维中,我发现80%的问题可以通过检查kubelet日志和Pod事件解决。建议将以下命令加入日常检查清单:

journalctl -u kubelet -f kubectl get events --sort-by='.metadata.creationTimestamp'
← 返回列表