모든 포스트

LLM 앱 운영 #6 보안 — 프롬프트 인젝션과 데이터 경계
5 분 소요

LLM 앱 운영 #6 보안 — 프롬프트 인젝션과 데이터 경계

프롬프트 인젝션은 입력 텍스트로 앱의 동작을 바꾸려는 시도이고, RAG와 에이전트 시대에는 문서와 도구 결과를 타고 들어옵니다. 단일 방어선이 아닌 겹겹의 방어, 도구 권한 최소화, 출력 검증, 로깅의 데이터 경계까지 다룹니다.

스마트폰은 어떻게 내 걸음을 셀까? 가속도 센서와 만보기의 원리
5 분 소요

스마트폰은 어떻게 내 걸음을 셀까? 가속도 센서와 만보기의 원리

주머니 속에서 폰이 하루 종일 걸음을 세고 있는데 배터리는 멀쩡한 이유를 풀어냅니다. 기울기와 흔들림을 느끼는 가속도 센서의 원리, 걸을 때마다 생기는 규칙적인 출렁임에서 걸음을 골라내는 방법, 버스의 덜컹임과 손 흔들기를 걸음으로 착각하지 않는 필터링, 센서 전담 저전력 칩이 밤새 세도 배터리가 닳지 않는 비밀, 그리고 만보기 앱마다 숫자가 다른 이유까지 비개발자 눈높이로 정리합니다.

LLM 앱 운영 #5 신뢰성 — 레이트리밋, 재시도, 폴백
5 분 소요

LLM 앱 운영 #5 신뢰성 — 레이트리밋, 재시도, 폴백

429와 529는 장애가 아니라 일상입니다. 레이트리밋의 구조(RPM·토큰 한도), retry-after를 존중하는 재시도, 타임아웃과 스트리밍, 그리고 그래도 안 될 때의 폴백(모델 강등·큐잉·정중한 실패)까지 멈추지 않는 구조를 만듭니다.

LLM 앱 운영 #4 배칭 — 급하지 않은 작업은 반값에
4 분 소요

LLM 앱 운영 #4 배칭 — 급하지 않은 작업은 반값에

당장 답이 필요 없는 작업까지 실시간 API로 보내고 있지 않은가요. Batches API는 대량 요청을 비동기로 처리하는 대신 모든 토큰을 50% 할인합니다. 배치에 맞는 작업 고르기, 제출과 수거, 운영 패턴까지 다룹니다.

LLM 앱 운영 #3 프롬프트 캐싱 실전
5 분 소요

LLM 앱 운영 #3 프롬프트 캐싱 실전

매 요청 반복되는 시스템 프롬프트와 도구 정의를 캐싱하면 그 구간의 입력 비용이 10분의 1이 됩니다. 접두사 일치라는 대원칙, 안정 접두사 설계, cache_control 배치, 침묵의 캐시 무효화를 찾는 감사까지 다룹니다.

LLM 앱 운영 #2 비용 — 토큰 회계와 모델 라우팅
5 분 소요

LLM 앱 운영 #2 비용 — 토큰 회계와 모델 라우팅

비용 절감의 가장 큰 지렛대는 모델 선택입니다. count_tokens로 보내기 전에 재기, 출력 길이 다이어트, 작업 난이도별 모델 라우팅 설계, effort 조절까지. 품질을 지키면서 비용을 내리는 순서를 다룹니다.

긴급재난문자는 내 번호를 몰라도 어떻게 올까? 셀 브로드캐스트의 원리
5 분 소요

긴급재난문자는 내 번호를 몰라도 어떻게 올까? 셀 브로드캐스트의 원리

재난문자는 문자메시지처럼 생겼지만 사실 문자메시지가 아닙니다. 번호로 한 명씩 보내는 대신 기지국이 전파 범위 안의 모든 폰에 방송하는 셀 브로드캐스트라는 별도 통로, 수백만 명에게 몇 초 만에 도달하고 통신망이 혼잡해도 밀리지 않는 이유, 지역을 콕 집어 보내는 방법, 위급·긴급·안전 등급이 갈리는 기준, 같은 방에 있는데 내 폰만 안 울리는 이유까지 비개발자 눈높이로 정리합니다.

LLM 앱 운영 #1 데모와 프로덕션 사이 — 운영의 지도
4 분 소요

LLM 앱 운영 #1 데모와 프로덕션 사이 — 운영의 지도

동작하는 LLM 앱과 운영할 수 있는 LLM 앱은 다릅니다. 비용, 지연, 신뢰성, 품질, 보안이라는 다섯 축으로 운영의 지도를 그리고, 모든 것의 출발점인 요청 단위 계측부터 만듭니다.

RAG 심화 #7 실전 프로젝트: 문서 Q&A 봇 업그레이드
4 분 소요

RAG 심화 #7 실전 프로젝트: 문서 Q&A 봇 업그레이드

LLM 앱 개발 실전 13편의 사내 문서 Q&A 봇을 시리즈의 기법으로 단계별로 업그레이드합니다. 기준선 측정부터 청킹 교체, 하이브리드 검색, 리랭킹, 인용까지 적용하며 지표가 어떻게 움직이는지 확인합니다.

RAG 심화 #6 RAG 평가 파이프라인 만들기
5 분 소요

RAG 심화 #6 RAG 평가 파이프라인 만들기

1편의 기준선을 평가 체계로 키웁니다. 검색은 recall@k와 MRR로, 생성은 LLM 판정자로 채점하고, 환각률까지 한 번에 재는 평가 스크립트를 만들어 모든 변경의 회귀 테스트로 돌립니다.

이모지는 누가 만들까? 유니코드, 그리고 기기마다 다르게 보이는 이유
5 분 소요

이모지는 누가 만들까? 유니코드, 그리고 기기마다 다르게 보이는 이유

새 이모지는 어느 회사 마음대로 추가하는 것이 아니라, 전 세계 글자를 관리하는 유니코드라는 표준 기구의 심사를 거쳐 태어납니다. 이모지의 정체가 그림이 아니라 글자와 같은 번호라는 것, 같은 이모지가 아이폰과 갤럭시에서 다르게 생긴 이유, 가족 이모지가 사실 여러 이모지의 합체라는 것, 피부색 변형의 원리, 그리고 남의 폰에서 네모 상자로 보이는 이유까지 비개발자 눈높이로 정리합니다.

RAG 심화 #5 인용으로 환각 줄이기
4 분 소요

RAG 심화 #5 인용으로 환각 줄이기

정답 조각을 줬는데도 답이 틀리는 생성 실패를 다룹니다. 근거 안에서만 답하게 하는 프롬프트, 모른다고 답할 권리, 그리고 Claude의 citations 기능으로 문장마다 출처를 다는 방법까지 구현합니다.