자원관리 정책 변경 (6/18 금)
페이지 정보
작성자 최고관리자 댓글 조회 작성일 22-03-15 10:06본문
자원관리정책 (21.6.18 변경)
| partition | 총 gpu 수 | base QoS | big QoS (옵션: -q big) |
|---|---|---|---|
| base (default) | 30 (node11~33) | 유저당 gpu max 4개 | GPU 유휴시 사용할 수 있도록 함. gpu 5개이상 사용가능 base QoS job이 대기가 생길 경우 3시간 유예후 preemption 됨 (base QoS job > big QoS job) |
| big (옵션: -p big) | 40 (node01~10) | 사용 불가 | gpu 개수 제한 없음 |
1. Partition (변동없음)
- 전체 노드는 2가지 파티션으로 나뉨: base partition, big partition
- 선택옵션: base partition은 default 이므로 option 지정안해도 됨, big partition은 -p big 옵션을 줘야 함
2. QoS (변동사항: preemption)
- 현재 2가지 QoS 임: base QoS (gpu 4개까지 사용가능), big QoS (gpu 개수 제한 없음)
- 선택 옵션: base QoS는 default이므로 옵션 지정 안해도됨, big QoS는 -q big 옵션을 줘야 함
실행 예) sbatch -p big-q big --gres=gpu:4 --time=1:00:00 ~/myjob.sh
- preemption 적용: 독점을 막고자 base partition에서는 base QoS job이
big QoS job보다 우선적으로 수행되도록 함.
base partition은 인당 max 4개의 GPU 사용하는 것을 원칙으로 하나, 유휴시
big QoS로 job을 돌릴 수 있음. 하지만 base QoS job이 대기가 생길 경우 3시간 유예후
priority를 고려하여 preemption됨
3. job의 실행 시간 (변동없음)
- 3일까지 실행 가능함
- 시간 옵션: --time="days-hours:minutes:seconds"
*** default 값 지정옵션이 없고 최대치(3일)가 default값으로 들어가므로 대기하는 유저들을 배려해
실제 사용할 만큼의 시간옵션을 지정해주시길 바랍니다. 그래야 대기자의 입장에서 실제적인 대기 시간 추정이 가능합니다 ***
4. 저장공간은 그룹에 관계없이 계정당 100G씩 주어짐 (변동없음)
인당 제출가능한 job의 수는 200개임. (변동사항: 전체 제출가능한 job의 수 200개의 제한은 없애고 무제한임)
댓글목록
등록된 댓글이 없습니다.
