분산 학습을 위한 AWS 컴퓨트 선택 가이드 (1편: 모델 규모와 하드웨어 선택)
대규모 언어 모델(LLM) 학습을 준비하는 팀이 가장 먼저 부딪히는 질문은 결국 “어떤 GPU를 얼마나, 어떻게 확보할 것인가”로 귀결됩니다. 그러나 이 질문은 H100이냐 B200이냐를 고르는 단순한 하드웨어 선택으로 끝나지 않습니다. 하나의 노드로 충분한지, 아니면 여러 노드로 확장해야 하는지, On-Demand로 그때그때 띄울지, Capacity Block으로 미리 예약할지, 평범한 EC2 클러스터로 감당이 되는지, 아니면 Amazon E
AI 코드 리뷰 자동화, 판정은 왜 흔들릴까? 원인과 해결법 4가지
같은 코드를 리뷰시켜도 판정이 매번 달라지는 이유는 LLM의 비결정성 때문입니다. temperature를 0으로 내려도 흔들림은 남습니다. 코드 위임·폭 좁히기·다수결·하네스로 LLM 판정의 일관성을 높이는 네 가지 방법을, 총 55회 호출 실험 결과와 함께 정리했습니다.
Amazon Bedrock 모델 promptfoo 로 성능 평가하기
들어가며 “프롬프트를 바꿨는데, 정말 더 나아진 걸까?” 생성형 AI 애플리케이션을 개발하는 엔지니어라면 누구나 한 번쯤 마주치는 질문입니다. 프롬프트 한 줄을 수정하거나 모델을 교체할 때마다 품질이 좋아졌는지 확신하기 어렵고, 여러 모델을 두고 어느 쪽이 서비스에 더 맞는지 판단하려면 같은 질문을 양쪽에 던져 결과를 일일이 눈으로 비교해야 합니다. 문제는 대규모 언어 모델(Large Language Model, 이하 LLM)이 비결정적(non
시멘틱 컨텍스트 OS 설계: 에이전트 시스템의 토큰 스터핑을 넘어
LY Corporation의 기술 컨퍼런스인 Tech-Verse 2026의 공식 기사입니다.대규모 언어 모델(large language model, 이하 LLM)의 물리적 입력 한...
LLM·하네스로 더 좋은 n8n 워크플로 생성하기
LLM에 정확한 정보와 도구를 제대로 쥐여 주면 더 높은 품질의 n8n 워크플로를 생성할 수 있습니다. 이 글은 LLM의 작업 환경 전체를 설계하는 접근 방식인 '하네스(Harness)'를 만들어 실험한 내용을 다뤘습니다. 같은 모델과 같은 요청을 두고 하네스 수준만 바꿨을 때 모델이 생성한 n8n 워크플로 품질이 어떻게 달라지는지 소개합니다.
MLXP : Kubernetes LLM Serving 최적화 기술 도입기
네이버 사내 기술 교류 행사인 NAVER ENGINEERING DAY 2026(5월)에서 발표되었던 세션을 공개합니다. 발표 내용 LLM 추론 성능을 극대화하기 위한 최신 기술들(KV Cache 인지 라우팅, Prefix Cache, 분산 멀티노드 서빙 등)을 Kubernetes 프로덕션 환경에 도입하는 과정에서 기존 인프라 스택(Istio 서비스 메시, 스케줄러, Pod 보호 정책)과 충돌하며 발생한 실전 문제들을 어떻게 진단하고 해결했는지
프롬프트 인젝션 방어: AgentCore 기반 다층 보안 설계 패턴
들어가며 LLM 기반 에이전트를 프로덕션으로 옮기는 순간, 모든 팀이 한 번쯤 마주치는 질문이 있습니다. “에이전트가 다른 사용자의 데이터를 노출하지 않는다는 걸 어떻게 보장할 수 있나요?” 주문 내역, 의료 기록, 사내 문서, 금융 거래 – 도메인이 무엇이든 질문의 본질은 같습니다. 이 문제를 해결하기 위해 많은 팀이 처음에는 시스템 프롬프트로 해결하려고 합니다. 보안 규칙: - 사용자에게 내부 […]
유저와 함께 만드는 LLM 2편 — 제타에 Online Learning 도입하기
AI 에이전트를 안전하게 움직이게 하는 설계도, ‘하네스 엔지니어링(Harness Engineering)’
최근 AI 개발의 흐름은 단순한 “질문과 답변”을 넘어, 스스로 작업을 계획하고 도구를 사용하며 결과물을 만들어내는 AI 에이전트(Agent) 중심으로 빠르게 이동하고 있습니다. 과거에는 “프롬프트를 어떻게 잘 쓰느냐”가 중요했다면, 이제는 “AI가 실제 업무 환경에서 얼마나 안정적으로 일하게 만들 수 있느냐”가 더 중요한 과제가 되고 있습니다. 아무리 성능이 뛰어난 LLM이라도, 어떤 파일을 읽어야 하는지, 어떤 도구를 사용해도 되는지, …
LLM은 모델보다 하네스가 먼저다: 만득이 한 달 수습기
AI 시대의 필수 소비재, 메모리 이해하기 3편: HBF가 풀어야 할 과제
HBF에게 적합한 자리는 분명히 있습니다. 하지만 memory hierarchy 피라미드에 들어가기 위해서는 아직 부족한 점이 많습니다. 최신 LLM 모델 및 추론 워크로드 트렌드, 그리고 Flash memory의 LLM 사용 방식을 살펴보며 HBF의 남은 과제와 극복 방안에 대해 살펴봅니다.
LLM은 언제 "모른다"고 말해야 하는가
정확하게 답하는 능력만큼 중요한, 답하지 않을 줄 아는 능력 이 글은 사내 본부 세미나에서 다룬 두 편의 논문 — AbstentionBench(Kirichenko et al., FAIR at Meta, arXiv:2...
AI에게 도메인을 가르치다 두 번 갈아엎은 이야기 — LLM Wiki + RAG 혼합기
도메인 지식을 LLM에게 먹이는 방법 — Inverted Index, 본문 임베딩, 요약 임베딩+FTS 세 가지 시도와 두 번의 갈아엎기
느려터진 에디터 좀 고쳐줘를 AI에게 시켜봤다
Auto Research 기법을 활용한 LLM 기반 자율 성능 개선 시스템 구축 여정
유저와 함께 만드는 LLM — 제타에 Preference Optimization 도입하기
LLM의 환각을 잠재울 지식의 지도, ‘온톨로지(Ontology)’
최근 대형 언어 모델(LLM)을 실제 서비스에 도입하려는 기업들의 가장 큰 고민은 ‘환각(Hallucination)’ 현상입니다. 이를 해결하기 위해 외부 데이터를 참조하는 RAG(검색 증강 생성) 기술이 표준처럼 자리 잡았습니다. 하지만 단순한 문서 검색만으로는 복잡한 추론이나 정확한 관계 파악에 한계가 있습니다. 이러한 RAG의 한계를 돌파하고, AI에게 인간 수준의 논리적이고 구조화된 지식을 제공하기 위해 다시금 주목받고 있는 개념이 바로
Slack 봇 쿼리곰: 없으면 안 되는 봇이 되기까지
범용 LLM 래퍼를 7.5주 만에 전사 필수 도구로 만든 구조 — 멀티에이전트 검증, Hybrid RAG, 이중 메모리
Amazon Bedrock 기반 Claude Code, 조직에서 안전하게 운영하기: LLM Gateway 구축 가이드
“개발자들이 AI 코딩 도구를 쓰고 싶다고 합니다. 보안팀에서 허용해도 될까요?” 이 질문은 이제 대부분의 엔터프라이즈 IT 리더가 마주하는 현실입니다. AI 코딩 도구의 생산성 향상 효과는 분명하지만, 기업 환경에서는 단순히 도구를 허용하는 것만으로 충분하지 않습니다. 누가, 얼마나 사용하는지 추적할 수 있어야 하고, 사용자별 예산을 제한할 수 있어야 하며, 조직의 기존 인증 체계와 통합되어야 합니다. Claude Code는 […]