데이터 센터

연세대학교 인공지능융합대학


공지

전체 노드 shutdown (8/17 화)

페이지 정보

작성자 최고관리자 댓글 조회 작성일 22-03-15 10:07

본문

8월 17일(화)에 시스템점검 진행합니다.

점검시간 : 8/17(화) 오전10~오후4시 (일찍 끝나는 경우 공지 예정)
내용:      
- 8월 정기점검      
- UPS 셋업 & 테스트      
- 자원 정책 변경

<주의사항>
* 8월17일10시~16시까지 시스템 예약이 걸려있기  때문에 이 시간을 침범하는 작업은 스케줄링 되지 않습니다. 
가령 8월 15일 12시에 작업을 넣는 경우 3일(default)로 넣으면 작업이 실행되지 않지만 1일로 넣으면 작업이 실행됩니다.

<자원정책변경>
1. partition명과 QoS명이 같아서 헷갈린다는 의견이 있어서 
    QoS명을 다음과 같이 변경합니다.

    base->base_qos    big->big_qos

   
2. cpu QoS/partition 추가

     cpu_qos : cpu job에 대해 8 cpu/node, 4개의 node사용이 가능

     >sbatch option으로 "-p cpu -q cpu_qos"를 줘야 함
     같은 노드에  cpu job을 더 넣고 싶은 경우 다음 옵션을 주면 됨     
     >sbatch option으로 "nodelist=nodeXX" (nodeXX는 이미 할당받은 노드여야 함)


3. partition 조정
     partition사용법과 각 gpu개수는 동일하나 그 내부에 속한 node들을 변경할 예정입니다.
     4개 gpu를 가진 node들이 대부분 big partition에 속하다 보니
     4개 gpu job을 base partition에서 돌리기 어렵다는 의견이 있었습니다.
     4개 gpu를 가진 node 12개를 base, big partition에 각각 6개씩 두겠습니다.

4. 독점 방지
     현재 잡이 할당되는 순위를 결정하는 priority는 여러가지 요소로 계산되어집니다.
     7월부터 갑자기 사용량이 많아지면서 독점에 대해 여러분이 문의를 주셨는데요.
     독점을 방지하고자 사용량에 대한 panalty의 비중을 높이는 방향으로 옵션을 조정하려고 합니다.

자세한 사항은 파일로 첨부하였습니다. 

첨부파일

댓글목록

등록된 댓글이 없습니다.