1. 从零开始:Kubernetes集群部署前的关键准备
在真正动手部署Kubernetes集群之前,我们需要做好充分的准备工作。就像建造房屋需要打地基一样,合理的准备工作能避免后续80%的部署问题。根据我多年部署Kubernetes集群的经验,以下这些环节最容易被忽视但至关重要。
1.1 硬件资源规划与节点角色分配
一个生产可用的Kubernetes集群至少需要3个节点(1个Master + 2个Worker)。但实际部署中,我建议采用3个Master节点实现高可用,Worker节点根据业务需求动态扩展。以下是硬件配置的黄金法则:
- Master节点:至少2核CPU/4GB内存/50GB磁盘(etcd数据目录单独挂载SSD)
- Worker节点:根据容器负载调整,建议4核CPU起/8GB内存/100GB磁盘
- 网络要求:节点间延迟<5ms,带宽≥1Gbps
特别注意:etcd对磁盘IOPS要求极高,使用云盘时务必选择高性能SSD。我曾遇到etcd因磁盘性能不足导致集群不可用的情况,更换为NVMe SSD后问题立即解决。
1.2 操作系统与内核参数调优
推荐使用CentOS 7.9+/Ubuntu 20.04 LTS作为宿主机系统。部署前必须完成以下系统配置:
# 关闭Swap(Kubernetes 1.8+强制要求) sudo swapoff -a sed -i '/ swap / s/^/#/' /etc/fstab # 加载内核模块 cat <<EOF | sudo tee /etc/modules-load.d/k8s.conf br_netfilter ip_vs ip_vs_rr ip_vs_wrr ip_vs_sh nf_conntrack EOF # 设置内核参数 cat <<EOF | sudo tee /etc/sysctl.d/k8s.conf net.bridge.bridge-nf-call-ip6tables = 1 net.bridge.bridge-nf-call-iptables = 1 net.ipv4.ip_forward = 1 vm.swappiness = 0 EOF sudo sysctl --system1.3 容器运行时选择与配置
虽然Docker仍是常见选择,但根据Kubernetes官方建议,我更推荐使用containerd作为运行时:
# 安装containerd sudo apt-get update && sudo apt-get install -y containerd sudo mkdir -p /etc/containerd containerd config default | sudo tee /etc/containerd/config.toml sudo systemctl restart containerd # 配置cgroup驱动为systemd(必须与kubelet一致) sudo sed -i 's/SystemdCgroup = false/SystemdCgroup = true/' /etc/containerd/config.toml2. 集群部署实战:kubeadm最佳实践
2.1 使用kubeadm初始化控制平面
以下命令将在第一个Master节点上初始化集群:
sudo kubeadm init \ --control-plane-endpoint "CLUSTER_API_ENDPOINT:6443" \ --upload-certs \ --pod-network-cidr=10.244.0.0/16 \ --service-cidr=10.96.0.0/12 \ --image-repository registry.aliyuncs.com/google_containers关键参数说明:
--control-plane-endpoint:负载均衡器地址(生产环境必须配置)--upload-certs:自动轮转证书--image-repository:使用国内镜像源加速
初始化成功后,按照提示配置kubectl:
mkdir -p $HOME/.kube sudo cp -i /etc/kubernetes/admin.conf $HOME/.kube/config sudo chown $(id -u):$(id -g) $HOME/.kube/config2.2 高可用控制平面部署
对于生产环境,需要添加额外的Master节点实现高可用:
kubeadm join 192.168.1.100:6443 \ --token <token> \ --discovery-token-ca-cert-hash sha256:<hash> \ --control-plane \ --certificate-key <key>高可用架构建议:
- 使用Keepalived + HAProxy实现API Server负载均衡
- etcd集群配置为独立节点(非堆叠式)提升稳定性
- 每个Master节点部署在不同可用区实现跨AZ容灾
2.3 工作节点加入集群
Worker节点加入命令与Master类似(去掉--control-plane参数):
kubeadm join 192.168.1.100:6443 \ --token <token> \ --discovery-token-ca-cert-hash sha256:<hash>3. 网络插件选型与部署
3.1 Calico网络方案实践
Calico是生产环境最常用的CNI插件,提供高性能网络策略:
kubectl apply -f https://docs.projectcalico.org/manifests/calico.yaml关键配置调优:
- 启用IPIP模式跨子网通信
- 配置IP地址池匹配pod-network-cidr
- 启用eBPF加速模式(内核>=4.18)
3.2 网络策略实战示例
以下策略只允许frontend Pod访问backend服务的80端口:
apiVersion: networking.k8s.io/v1 kind: NetworkPolicy metadata: name: backend-allow-frontend spec: podSelector: matchLabels: app: backend ingress: - from: - podSelector: matchLabels: app: frontend ports: - protocol: TCP port: 804. 存储方案设计与实现
4.1 动态存储供应配置
以NFS为例创建StorageClass:
apiVersion: storage.k8s.io/v1 kind: StorageClass metadata: name: nfs-storage provisioner: example.com/nfs parameters: server: nfs-server.example.com path: /share4.2 CSI驱动集成实践
以AWS EBS为例:
kubectl apply -k "github.com/kubernetes-sigs/aws-ebs-csi-driver/deploy/kubernetes/overlays/stable/?ref=master"创建StorageClass:
apiVersion: storage.k8s.io/v1 kind: StorageClass metadata: name: ebs-sc provisioner: ebs.csi.aws.com volumeBindingMode: WaitForFirstConsumer5. DevOps流水线集成
5.1 GitOps工作流实现
使用Argo CD部署应用:
kubectl create namespace argocd kubectl apply -n argocd -f https://raw.githubusercontent.com/argoproj/argo-cd/stable/manifests/install.yaml配置自动同步:
apiVersion: argoproj.io/v1alpha1 kind: Application metadata: name: myapp spec: destination: server: https://kubernetes.default.svc namespace: default source: repoURL: https://github.com/example/myapp.git targetRevision: HEAD path: k8s syncPolicy: automated: selfHeal: true prune: true5.2 Tekton CI/CD流水线示例
定义构建任务:
apiVersion: tekton.dev/v1beta1 kind: Task metadata: name: build-push spec: steps: - name: build image: maven:3.6.0-jdk-11 command: ["mvn", "clean", "package"] - name: build-image image: gcr.io/kaniko-project/executor:latest args: [ "--dockerfile=Dockerfile", "--context=.", "--destination=gcr.io/myproject/myimage:latest" ]6. 监控与日志方案
6.1 Prometheus-Operator部署
使用kube-prometheus-stack:
helm repo add prometheus-community https://prometheus-community.github.io/helm-charts helm install kube-prometheus-stack prometheus-community/kube-prometheus-stack \ --namespace monitoring \ --create-namespace6.2 EFK日志收集方案
部署Elasticsearch+Fluentd+Kibana:
helm install elasticsearch elastic/elasticsearch \ --namespace logging \ --create-namespace helm install fluentd fluent/fluentd \ --namespace logging \ --set elasticsearch.host=elasticsearch-master.logging.svc.cluster.local helm install kibana elastic/kibana \ --namespace logging \ --set service.type=NodePort7. 安全加固实践
7.1 RBAC权限控制
创建最小权限ServiceAccount:
apiVersion: v1 kind: ServiceAccount metadata: name: ci-deployer --- apiVersion: rbac.authorization.k8s.io/v1 kind: Role metadata: name: deployer-role rules: - apiGroups: ["apps"] resources: ["deployments"] verbs: ["get", "list", "watch", "create", "update", "patch"] --- apiVersion: rbac.authorization.k8s.io/v1 kind: RoleBinding metadata: name: deployer-binding subjects: - kind: ServiceAccount name: ci-deployer roleRef: kind: Role name: deployer-role7.2 Pod安全策略
使用PodSecurityPolicy限制特权容器:
apiVersion: policy/v1beta1 kind: PodSecurityPolicy metadata: name: restricted spec: privileged: false allowPrivilegeEscalation: false requiredDropCapabilities: - ALL volumes: - 'configMap' - 'emptyDir' - 'secret' hostNetwork: false hostIPC: false hostPID: false runAsUser: rule: 'MustRunAsNonRoot'8. 生产环境运维技巧
8.1 集群升级策略
使用kubeadm进行原地升级:
# 升级控制平面 sudo apt-get update && sudo apt-get install -y kubeadm=1.22.5-00 sudo kubeadm upgrade plan sudo kubeadm upgrade apply v1.22.5 # 升级节点 sudo apt-get update && sudo apt-get install -y kubelet=1.22.5-00 kubectl=1.22.5-00 sudo systemctl daemon-reload sudo systemctl restart kubelet8.2 故障排查命令大全
常用诊断命令:
# 查看节点状态 kubectl get nodes -o wide # 检查Pod事件 kubectl describe pod <pod-name> # 查看容器日志 kubectl logs -f <pod-name> -c <container-name> # 网络连通性测试 kubectl run -it --rm --restart=Never test-pod --image=busybox -- sh # API健康检查 curl -k https://localhost:6443/healthz在实际生产运维中,我发现80%的问题可以通过检查kubelet日志和Pod事件解决。建议将以下命令加入日常检查清单:
journalctl -u kubelet -f kubectl get events --sort-by='.metadata.creationTimestamp'