데이터 센터

연세대학교 인공지능융합대학


주의사항

Total 1건 1 페이지
주의사항 목록
번호 제목 작성일
1


1. 접속

인공지능대학원데이터센터는 교내에서만 접속이 가능합니다.

외부에서 접속할 경우 vpn을 사용하시기 바랍니다. Yonsei WIFI 연결시에도 vpn으로 접속하시기 바랍니다.

(vpn 신청: https://ysvpn.yonsei.ac.kr)

2. 데이터 백업 미지원

백업서버가 따로 준비되어있지 않으므로 데이터 백업은 본인이 신경써야 합니다.

3. sbatch 권장

클러스터 자원낭비를 최소화하기 위해 srun은 가급적 이용하지 마시고 sbatch를 사용하시기 바랍니다.

srun을 수행하는 경우 수행이 끝나고 exit을 안하면, 자원이 허용된 시간까지 할당된 상태로 유지되어서 다른 사용자한테 자원배정이 되지 않습니다.

srun으로 자원할당을 받고 사용안하는 경우가 많아 이를 방지하고자,

srun으로 배정받은 job은 자동으로 6시간후에 cancel되오니 이점 양지하시기 바랍니다.

4. 자원배정

클러스터 자원은 자원관리자(SLURM)을 통해 배정받아서 사용해야 합니다.

$CUDA_VISIBLE_DEVICES 를 선언하지 않도록 주의해주시고 외부코드를 가져오시는 경우에도 해당 코드가 있는지 확인하시고 수정하셔서 사용해야 합니다.

5. login 서버에서의 job 수행 주의

login서버가 느려져서 타인에게 피해를 주는 경우가 없도록 login 서버에서 top명령어/htop명령어를 이용하여 본인 process의 load를 확인해주셔야 합니다.

<다음과 같은 상황에서는 사용자에게 알리지 않고 관리자가 로그인서버의 process를 강제 종료합니다>

1. CPU 100%이상 사용하는 process가 3일 이상 그대로 떠 있는 경우 강제종료한다

    (이 경우, owner가 본인의 process가 떠있는지 조차 모르는 경우가 많습니다)

2. CPU 200%이상 사용하는 process의 경우 즉각 강제 종료한다

3. memory 5%이상 사용하는 process가 1일이상 그대로 떠 있는 경우 강제종료한다

4. memory 20%이상 사용하는 process의 경우 즉각 강제 종료한다

* 혹시 어쩔수 없는 상황이 있다면 사전에 관리자에게 논의해주시기 바랍니다

6. download 주의사항

1) download는 반드시 login서버에서 실행해야 합니다. 작업노드(gpu node, cpu node)에서 실행하는 경우 마스터 서버에 병목이 생겨서 전체 클러스터가 느려집니다.

2) download 받는 데이터는 반드시 NAS에 저장해야 합니다. /home에 저장하는 경우 마스터 서버에 병목이 생겨 전체 클러스터가 느려집니다.

3) NAS에 저장된 파일은 atime이 30일 이상된 경우 자동 삭제됩니다.

   access(읽기)만 하는 경우 네트워크로 연결되는 경우 atime이 갱신되지 않아 삭제 대상이 되므로 30일 전에 touch명령어를 실행해주셔야 합니다.

   touch 명령어는 recursive옵션이 없으므로 다음과 같이 명령어를 입력해주시면 됩니다.

   >> find 디렉토리네임 -print | xargs touch

4) download 받는 경우 파일의 atime이 download 시간이 아닐 수 있으므로 다운로드 직후에도 아래 명령어를 수행합니다.

   >> find 디렉토리네임 -print | xargs touch