#GPU
4 편의 글
5 분 소요
LLM 자체 호스팅에 필요한 서버 규모 추정: VRAM 계산부터 동시 사용자까지
사내 LLM을 자체 호스팅할 때 필요한 GPU 규모를 추정하는 순서를 정리합니다. 파라미터 수와 정밀도로 하는 VRAM 계산, KV 캐시와 동시 요청의 관계, 메모리 대역폭과 토큰 생성 속도, 시나리오별 구성 예시, 자체 호스팅과 API의 손익분기까지 다룹니다.
5 분 소요
AI 학습 서버와 추론 서버의 차이: 사양이 갈리는 기준
같은 GPU 서버인데 학습용과 추론용의 사양이 갈리는 이유를 정리합니다. 배치 처리와 요청 처리라는 워크로드 형태 차이, GPU 간 통신과 메모리 대역폭이라는 병목 차이, 정밀도와 양자화, 비용 구조와 겸용의 함정까지 장비 선택 관점으로 다룹니다.
5 분 소요
NVIDIA GPU 이름 읽는 법: 아키텍처 세대와 라인업 정리
H100, B200, GB300, L40S, RTX 5090 같은 NVIDIA GPU 이름을 체계로 읽는 법을 정리합니다. 과학자 이름의 아키텍처 세대 축과 데이터센터·추론·소비자 제품 라인 축, 숫자와 접두사의 의미, 2026년 중반 기준 세대 현황과 로드맵까지 다룹니다.
5 분 소요
GPU 서버와 일반 서버의 차이: 구조, 전력, 냉각, 가격
GPU 서버가 일반 서버와 어디서부터 다른 물건인지 정리합니다. GPU 중심으로 뒤집힌 서버 구조와 인터커넥트, 자릿수가 다른 전력 밀도와 액체 냉각의 등장, 가격 구조, 드라이버 스택과 활용률 관리까지, 도입 전에 알아야 할 차이를 다룹니다.