목록전체 글 (39)
Tess's Infra Engineering Journey
장애를 증상 → 범위 → 최근 변경 → 계층별 확인 순서로 쪼개는 습관 만들기CPU/Memory/Network 같은 개별 지표보다 먼저 어디까지 정상인가?를 판단하기재시작 전에 반드시 남겨야 할 증거와 명령을 익히기1. 장애 대응에서 SRE 관점으로 질문하기1. 정확히 뭐가 안 되는가?2. 누구에게 안 되는가?3. 언제부터 안 되었는가?4. 어디까지는 정상인가?5. 직전에 무엇이 바뀌었는가?6. 어느 계층이 의심되는가? 2. Symptom -> Scope 증상을 구체화 1) 서버 전체가 느린 경우uptimetopvmstat 1*vmstat(Virtual Memory Statistics)CPU / process / memory / swap / I/O 상태를 한 번에 빠르게 보는 명령procs -------..
이직을 위해 포트폴리오 만들 겸 공부도 할 겸 다시 시작했던 기술 블로그..이후 이런 저런 일들이 생겨 글은 업로드 하지 못했다. 업무적으로는 기존에 구축했던 시스템 관리+최적화, 로컬 LLM 활용한 RAG시스템을 새로 구축하는 일에 몰두했다.개인적으로는 그동안 계획한 것들(이직하지 않고 현재 회사에 정착하기를 포함한)을 뒤흔드는 일을 겪었다.그 후 현재에 타협하지 않기로 결정했고, 적극적으로 구직을 하기 시작했다. 마침 가고 싶었던 회사중 한곳에서(외국계라 수시채용임) infra 직무 공고가 딱 떴다. 5 + years experience를 요구했으나, 반도체 설계라는 상당히 좁은 업계에서나와 같은 직무를 경험한 사람은 아주 소수일거라는 당당함(!) 으로 지원해보기로 했다.영문 resume를 대충 작성..
open source인 SLURM을 구축하는데 있어서 여러 어려움들이 있었지만,가장 처음으로 애를 쓰게 되는 지점, 바로 'munge'다. munge가 뭔지는(ㅋㅋ) GPT의 설명을 인용한다.. MUNGE (MUNGE Uid ‘N’ Gid Emporium) → HPC(고성능 컴퓨팅) 클러스터에서 인증(authentication) 을 담당하는 경량 데몬. 클러스터 노드 간 신뢰할 수 있는 인증 토큰 발급/검증 Kerberos, LDAP 같은 복잡한 인증 대신 HPC 환경에서 Slurm, MPI 등과 쉽게 연동 /etc/munge/munge.key 라는 공유 키 파일을 기반으로 동작 즉, Slurm 같은 워크로드 매니저가 “이 요청이 믿을 만한 사용자인지” 확인할 수 있게 해주는 필수 서비스입니다. S..
2025년 초,그룹장님 : 우리 하반기엔 반도체 엔지니어들을 위한 사내 지식 창고를 만들어 보자! chloe가 어떤 툴을 쓰면 좋을지 조사해봐!나 : ??? 요구사항은 아래와 같았다.1. 게시판 형태로 글을 관리할 수 있을 것2. 사용자들끼리 토론이 가능 할 것3. 폐쇄망에서 사용 가능 할 것4. 예쁠 것 가장 먼저 떠오른건 나무위키, 그 다음은 raddit... 뭐 이런 형태로 만들어야 하나? chatGPT한테 우리 목적에 맞는 툴을 추천해달라하니,Wiki.js, Flarum을 추천해줬다. 1. Wiki.jshttps://js.wiki/Wiki.js는 일단 이름이 맘에 들었고, 직관적인 UI가 맘에 들었다.Docker는 잘 못다루지만 어찌저찌 띄워봤는데, (GPT최고)정말 위키백과, 나무위키처럼 페이지..
인프라 엔지니어의 기록을 남겨본다정보보안 전문가를 꿈꾸며 개설했던 블로그였는데어느새 나는 반도체 디자인하우스에서 IT Infra Engineer(?) 3년차. 비전공자로서 회사 입사 후에야 Linux를 제대로 써본 나지만,SLURM을 구축해 150여개의 노드를 갖춘 클러스터를 운영하는 중이고Streamlit을 활용한 서버 모니터링 대시보드도 만들고, Docker로 Discourse를 띄워 사내 위키 같은 것(?)도 구축해봤다. EDA Tool을 사용하는 엔지니어들과 일하다 보면 늘 예상치 못한 문제가 생긴다.Tool 자체가 워낙 무거운 탓에 VNC 접속이 안 된다든가, 갑자기 멈췄다던가잡이 몰려서 SLURM이 엉킨다든가, 프로세스가 D 상태로 멈춰버리기도 한다.그때마다 ChatGPT와 함께 로그를 뒤지고..
