GPU node의 경우 2가지 partition이 있습니다
AI 연구하는 학생들의 편의를 위해 독점을 허용하는 big partition(gpu 50장까지 허용- 변동 가능)과 공평하게 자원을 나누어쓸 수 있는 base partition이 있습니다.
그런데 base partition은 인당 4장의 gpu를 허용하다보니 유휴자원이 생겨도 4장 이상 필요한 사람들은 못쓰게 되어 사용자가 적은 경우 GPU사용률이 저조하게 됩니다.
하여 job의 QoS를 나누어서 base_q는 gpu 4장씩 허용하고 big_q는 gpu 50장 사용(변동 가능)이 가능합니다.
하지만 base_q의 우선순위를 높게 하여 big_q job이 여러개 돌고 있을 때 base_q job이 대기하는 경우 대기 시점에서 3시간 후에 preemption 될 수 있도록 해놓았습니다.
preemption되면서 아래와 같은 형태의 메시지가 발생합니다.
slurmstepd: error: *** JOB 355071 ON node14 CANCELLED AT 2023-05-22T04:22:49 DUE TO PREEMPTION ***
job을 여러개 돌리면서 preemption되지 않길 원하는 경우 big partition의 노드를 배정받아야 합니다.
이에 대해 좀 더 자세히 설명한 부분은 아래 페이지를 참고하시기 바랍니다.
https://computing.yonsei.ac.kr/bbs/board.php?bo_table=sub6_2_c
"공평"과 "자원활용의 최대화"를 만족시킬 수 있는 좋은 의견있으시면 언제든 알려주세요.