Microsoft MVP성태의 닷넷 이야기
글쓴 사람
정성태 (techsharer at outlook.com)
홈페이지
첨부 파일
 

AKS에서 hpa에 따른 autoscale 기능이 동작하지 않는다면?

결과 먼저 말하자면, 원인을 밝혀내진 못했으니 그냥 참고삼아 보시면 되겠습니다. ^^




Azure에 생성한 AKS 서비스에서 autoscale 설정을 했는데,

$ kubectl autoscale deployment --max=10 net-razor31-sample --min=2

아무리 부하를 줘도 pod는 그대로 2개에 머물고 있습니다.

$ kubectl get pods
NAME                                  READY   STATUS    RESTARTS   AGE
net-razor31-sample-6b747bb886-ncvvw   1/1     Running   0          4m51s
net-razor31-sample-6b747bb886-sxkbj   1/1     Running   0          5m6s

hpa 설정을 보면 이상 없는 듯한데요,

$ kubectl get hpa
NAME                 REFERENCE                       TARGETS         MINPODS   MAXPODS   REPLICAS   AGE
net-razor31-sample   Deployment/net-razor31-sample   <unknown>/80%   2         10        2          6m50s

실제로는 이상이 있는 것입니다. ^^ 문제가 되는 부분은 "TARGETS"의 조건인데 여기에 "<unknown>"이 나오는 것은 현재 해당 시스템의 성능 metrics 데이터를 정상적으로 가져오지 못한다는 것을 의미합니다. 따라서 부하 측정을 할 수 없고 당연히 autoscale을 위한 기준을 잡지 못하는 것입니다.




기본적으로 (근래 버전의 k8s를 선택한 경우) AKS는 metrics-server 구성 요소를 이미 준비하고 있습니다.

C:\temp> kubectl get pod --all-namespaces
NAMESPACE     NAME                                  READY   STATUS    RESTARTS   AGE
default       net-razor31-sample-6b747bb886-mldk2   0/1     Pending   0          107s
kube-system   azure-ip-masq-agent-tmqtq             1/1     Running   0          6h
kube-system   coredns-845757d86-7bzwn               1/1     Running   0          17h
kube-system   coredns-845757d86-rljs8               1/1     Running   0          17h
kube-system   coredns-autoscaler-5f85dc856b-m9s57   1/1     Running   0          17h
kube-system   csi-azuredisk-node-ltfl4              3/3     Running   0          6h
kube-system   csi-azurefile-node-8xggf              3/3     Running   0          6h
kube-system   kube-proxy-p4zj6                      1/1     Running   0          17h
kube-system   metrics-server-6bc97b47f7-6tqms       1/1     Running   0          17h
kube-system   tunnelfront-78bc5d7569-fvlth          1/1     Running   0          16h

따라서 성능 메트릭 데이터를 수집하지 못할 이유가 없는데요, 이에 대한 문제를 describe hpa로 살펴볼 수 있습니다.

c:\temp> kubectl describe hpa net-razor31-sample
Name:                                                  net-razor31-sample
Namespace:                                             default
Labels:                                                <none>
Annotations:                                           <none>
CreationTimestamp:                                     Tue, 25 Jan 2022 15:44:52 +0900
Reference:                                             Deployment/net-razor31-sample
Metrics:                                               ( current / target )
  resource cpu on pods  (as a percentage of request):  <unknown> / 80%
Min replicas:                                          2
Max replicas:                                          10
Deployment pods:                                       2 current / 2 desired
Conditions:
  Type           Status  Reason                   Message
  ----           ------  ------                   -------
  AbleToScale    True    SucceededGetScale        the HPA controller was able to get the target's current scale
  ScalingActive  False   FailedGetResourceMetric  the HPA was unable to compute the replica count: failed to get cpu utilization: missing request for cpu
Events:
  Type     Reason                        Age   From                       Message
  ----     ------                        ----  ----                       -------
  Normal   SuccessfulRescale             33s   horizontal-pod-autoscaler  New size: 2; reason: Current number of replicas below Spec.MinReplicas
  Warning  FailedGetResourceMetric       18s   horizontal-pod-autoscaler  failed to get cpu utilization: unable to get metrics for resource cpu: no metrics returned from resource metrics API
  Warning  FailedComputeMetricsReplicas  18s   horizontal-pod-autoscaler  invalid metrics (1 invalid out of 1), first error is: failed to get cpu utilization: unable to get metrics for resource cpu: no metrics returned from resource metrics API
  Warning  FailedGetResourceMetric       3s    horizontal-pod-autoscaler  failed to get cpu utilization: missing request for cpu
  Warning  FailedComputeMetricsReplicas  3s    horizontal-pod-autoscaler  invalid metrics (1 invalid out of 1), first error is: failed to get cpu utilization: missing request for cpu

위의 결과에 보면, "failed to get cpu utilization: unable to get metrics for resource cpu: no metrics returned from resource metrics API"라는 메시지가 있는데요, 뭔가 해당 pod에서 CPU 자원을 구하는 코드가 동작하지 않는 듯합니다.

이상한 것은, top nodes나 top pods 옵션에서는 CPU 정보를 잘 가져온다는 점입니다.

c:\temp> kubectl top nodes
NAME                                CPU(cores)   CPU%   MEMORY(bytes)   MEMORY%
aks-agentpool-20726260-vmss000000   216m         11%    2073Mi          45%

c:\temp> kubectl top pods
NAME                                  CPU(cores)   MEMORY(bytes)
net-razor31-sample-574ffd4758-4zlxm   2m           52Mi
net-razor31-sample-574ffd4758-7szr8   1m           54Mi
sample-back-56bf7ff864-7hdzm          2m           14Mi
sample-front-65fd487fdf-jjhwh         1m           43Mi
sample-front-65fd487fdf-sjcbr         1m           43Mi

참... 이걸 뭐라고 설명해야 할지 모르겠군요. ^^;




웹 검색을 했지만, 딱히 이거라고 할 만한 오류 원인을 찾지 못했습니다. 그래서 어쩔 수 없이 AKS 클러스터를 새로 생성하는 것으로 해결을 했습니다.

단지, 이전 실습과 다르게 한 점이 있다면,

AKS - Azure Kubernetes Service 생성 및 SLO/SLA 변경 방법
; https://www.sysnet.pe.kr/2/0/12922

이번에는 클러스터 생성 시 ACR까지 함께 생성했다는 점입니다. 그 외에는 (쿠버네티스 버전을 포함한) 모든 옵션들이 이전 클러스터 생성과 다른 점이 없었습니다. 하지만 상식적으로 ACR이 성능 메트릭스를 가져오는 것에 영향을 미쳤을 것 같지는 않고, 테스트 플랫폼이라 이거저거 실습하느라 건드린 무엇인가가... 문제였을 듯합니다.




[이 글에 대해서 여러분들과 의견을 공유하고 싶습니다. 틀리거나 미흡한 부분 또는 의문 사항이 있으시면 언제든 댓글 남겨주십시오.]







[최초 등록일: ]
[최종 수정일: 1/26/2022]

Creative Commons License
이 저작물은 크리에이티브 커먼즈 코리아 저작자표시-비영리-변경금지 2.0 대한민국 라이센스에 따라 이용하실 수 있습니다.
by SeongTae Jeong, mailto:techsharer at outlook.com

비밀번호

댓글 작성자
 




... 46  47  48  49  50  51  52  53  54  55  56  57  58  59  [60]  ...
NoWriterDateCnt.TitleFile(s)
12531정성태2/5/202120338개발 환경 구성: 537. Wireshark + C#으로 확인하는 PSH flag와 Nagle 알고리듬파일 다운로드1
12530정성태2/4/202123010개발 환경 구성: 536. Wireshark + C#으로 확인하는 TCP 통신의 Receive Window
12529정성태2/4/202122337개발 환경 구성: 535. Wireshark + C#으로 확인하는 TCP 통신의 MIN RTO [1]
12528정성태2/1/202122828개발 환경 구성: 534. Wireshark + C#으로 확인하는 TCP 통신의 MSS(Maximum Segment Size) - 윈도우 환경
12527정성태2/1/202122766개발 환경 구성: 533. Wireshark + C#으로 확인하는 TCP 통신의 MSS(Maximum Segment Size) - 리눅스 환경파일 다운로드1
12526정성태2/1/202119374개발 환경 구성: 532. Azure Devops의 파이프라인 빌드 시 snk 파일 다루는 방법 - Secure file
12525정성태2/1/202117875개발 환경 구성: 531. Azure Devops - 파이프라인 실행 시 빌드 이벤트를 생략하는 방법
12524정성태1/31/202117635개발 환경 구성: 530. 기존 github 프로젝트를 Azure Devops의 빌드 Pipeline에 연결하는 방법 [1]
12523정성태1/31/202120646개발 환경 구성: 529. 기존 github 프로젝트를 Azure Devops의 Board에 연결하는 방법
12522정성태1/31/202122945개발 환경 구성: 528. 오라클 클라우드의 리눅스 VM - 9000 MTU Jumbo Frame 테스트
12521정성태1/31/202120175개발 환경 구성: 527. 이더넷(Ethernet) 환경의 TCP 통신에서 MSS(Maximum Segment Size) 확인 [1]
12520정성태1/30/202119472개발 환경 구성: 526. 오라클 클라우드의 VM에 ping ICMP 여는 방법
12519정성태1/30/202119038개발 환경 구성: 525. 오라클 클라우드의 VM을 외부에서 접근하기 위해 포트 여는 방법
12518정성태1/30/202137517Linux: 37. Ubuntu에 Wireshark 설치 [2]
12517정성태1/30/202124137Linux: 36. 윈도우 클라이언트에서 X2Go를 이용한 원격 리눅스의 GUI 접속 - 우분투 20.04
12516정성태1/29/202120687Windows: 188. Windows - TCP default template 설정 방법
12515정성태1/28/202123173웹: 41. Microsoft Edge - localhost에 대해 http 접근 시 무조건 https로 바뀌는 문제 [3]
12514정성태1/28/202123473.NET Framework: 1021. C# - 일렉트론 닷넷(Electron.NET) 소개 [1]파일 다운로드1
12513정성태1/28/202118688오류 유형: 698. electronize - User Profile 디렉터리에 공백 문자가 있는 경우 빌드가 실패하는 문제 [1]
12512정성태1/28/202121377오류 유형: 697. The program can't start because VCRUNTIME140.dll is missing from your computer. Try reinstalling the program to fix this problem.
12511정성태1/27/202120717Windows: 187. Windows - 도스 시절의 8.3 경로를 알아내는 방법
12510정성태1/27/202121567.NET Framework: 1020. .NET Core Kestrel 호스팅 - Razor 지원 추가 [1]파일 다운로드1
12509정성태1/27/202119599개발 환경 구성: 524. Jupyter Notebook에서 C#(F#, PowerShell) 언어 사용을 위한 환경 구성 [3]
12508정성태1/27/202120734개발 환경 구성: 523. Jupyter Notebook - Slide 플레이 버튼이 없는 경우
12507정성태1/26/202121156VS.NET IDE: 157. Visual Studio - Syntax Visualizer 메뉴가 없는 경우
12506정성태1/25/202123872.NET Framework: 1019. Microsoft.Tye 기본 사용법 소개 [1]
... 46  47  48  49  50  51  52  53  54  55  56  57  58  59  [60]  ...