AI 모델의 성능, 우리는 제대로 평가하고 있을까?
Benchmark Contamination과 Double-Blind Evaluation 새로운 AI 모델이 공개될 때마다 다양한 벤치마크 점수가 함께 발표됩니다. 추론, 수학, 코딩, 안전성 등 모델의 능력을 하나의 숫자로 비교할 수 있기 때문에 벤치마크는 AI 모델의 성능을 판단하는 대표적인 기준으로 활용되고 있습니다. 하지만 모델의 학습 데이터가 점점 방대해지면서 한 가지 질문이 중요해지고 있습니다. 모델이 평가 문제를 이미 본 적이 있다면
Claude Code 토큰 비용 최적화하기 – 2부: 캐시 경제학과 Amazon Bedrock 조직 비용 관리
Claude Code를 조직에 도입하면 개인의 습관만으로는 답할 수 없는 질문이 남습니다. 자리를 비웠다 돌아오면 첫 응답이 왜 유난히 느리고 비싼지, Amazon Bedrock으로 사용하는 조직에서는 누가 얼마나 쓰는지를 어디서 확인할 수 있는지 같은 질문입니다. 이 글은 Claude Code 토큰 비용 최적화 시리즈의 2부입니다. 1부(비용 구조와 세션 습관)에서는 비용이 컨텍스트 크기에 비례하고 실제 지불 단가는 프롬프트 캐싱(prompt
Claude Code 토큰 비용 최적화하기 – 1부: 비용 구조와 세션 습관
Claude Code를 팀에 도입하고 나면 비슷한 질문들이 찾아옵니다. 짧은 한 문장의 질문만 했는데 토큰 사용량이 왜 이렇게 높은지, 하루가 끝날 때쯤이면 세션이 왜 이렇게 무거워져 있는지 같은 의문입니다. Claude Code는 메시지를 보낼 때마다 시스템 프롬프트, 프로젝트 컨텍스트, 지금까지의 전체 대화 이력을 다시 전송하고, 비용은 그 컨텍스트 크기에 비례합니다. 그리고 실제로 지불하는 토큰 단가는 프롬프트 캐싱(prompt […]
OpenAI에서 직접 알려주는 Codex 사용법
에이전틱 프로그래밍 가이드라인과 모두를 위한 Codex 실전 사용 팁
AI를 활용한 테스트 자동화 도전기
LLM에게 수백 MB 로그를 통째로 주지 마세요 — 근거를 "검증"할 수 있는 AI 이슈 분석 에이전트 개발기
개발자는 이슈를 해결하기 전에 이슈를 찾고 읽으며 수백 MB의 로그를 뒤지는 데 하루의 상당 시간을 씁니다. 이 글은 그 시간을 되찾기 위해 만든 AI 이슈 분석 에이전트의 개발기입니다. 로그를 LLM에 통째로 넣었다가 실패한 이야기부터 결정적 전처리 파이프라인, 환각을 구조적으로 차단하는 인용 규율, 빌드가 지키는 아키텍처까지 개발 과정의 실패와 결정을 있는 그대로 담았습니다.
삼쩜삼, 카카오 주관 ‘모두의 AI’ 컨소시엄 합류
과기정통부 ‘모두의 AI’ 사업, 카카오 컨소시엄 세무 분야 전문기업으로 합류 첫 정부 사업 참여…세무 전문성·AI 기술 역
통합임베딩으로 개인화 푸시 CTR +21.3%를 만든 과정
비용과 성능을 한번에 - 언어 특화 토크나이저 도입기
같은 말을, 절반의 토큰으로
[Team Spotlight] '아티스트 유닛' 음악 듣는 곳을 넘어 팬과 아티스트가 만나는 곳을 만듭니다.
더 많은 음악이 팬을 만나고, 더 큰 무대로 이어져 성장할 수 있도록 음악 IP의 생애주기를 설계하고 성장시키는 드림어스컴퍼니의 IP 풀 밸류체인을 직접 만드는 팀과 사람들을 소개합니다. 음악을 듣다가 한 아티스트가 좋아지고, 더 알고 싶어지고, 직접 응원하고 싶어지는 순간이 있습니다. 이때 팬에게 필요한 것은 음악을 듣는 공간을 넘어 아티스트와 더 가까이 소통하고 다양한 방식으로 팬 활동을 즐길 수 있는 공간입니다. 드림어스컴퍼니 아티스트유닛
곧, if(kakao)26의 이야기가 시작됩니다.
“모든 연결에 지능을” if(kakao)26은 이 한 문장에서 시작합니다. 카카오가 기술을 만들며 마주한 고민과 질문, 그 과정에서 얻은 경험과 발견을 나누는 if(kakao)26! 어떤 이야기들이 기다리고 있을지 궁금하신가요? 앞으로 카카오테크 블로그를 통해 if(kakao)26의 다양한 이야기를 하나씩 소개해 드릴 예정입니다! 하나씩 공개될 if(kakao)26의 새로운 이야기를 기대해 주세요! 🔗 if(kakao)26 미리 만나보기
같은 장애를 두 번 겪지 않기 위해, 배포 전에 리뷰합니다 — KRIS 개발기
들어가며 지난 글 LLM as a Judge를 활용한 CodeBuddy 성능 평가에서는 사내 AI 코드 리뷰 서비스 코드버디(CodeBuddy)의 응답 품질을 어떻게 측정할 것인지를 다뤘습니다. 평가 체계를 세우고 나니 다음 질문이 따라왔습니다. "그래서 이 리뷰가 실제로 무엇을 막아주고 있는가?" 코드버디는 PR을 요약하고(describe), 리뷰하고(review), 개선안을 제안합니다(improve). 정확도는 꾸준히 올라갔습니다. 그런데
프롬프트를 쓰는 PM과 AI를 이해시키려는 개발자
올리브영은 2026년 3월 24일, 카카오와의 협업으로 올리브영의 뷰티 상품을 카카오톡 대화방에서 바로 추천받을 수 있는 MCP를 선보였습니다. 그리고 이때 다진 MCP 구조를 토대로, 2026년 8월에는 챗GPT…
[신청 중] AI Product Frontiers: AI 시대, 최전선에서 방향을 만드는 사람들
FriendliAI, Upstage, Channel의 글로벌 AI 리더들이 한 자리에 모입니다
Gemini 3.5 Transcribe 등 8월 넷째 주 Google for Developers 위클리 업데이트를 지금 확인하세요!
개발자 여러분, 안녕하세요!8월 넷째 주 블로그에 발표된 Google의 주요 개발자 제품별 최신 소식을 살펴보세요.[주요 개발자 블로그 업데이트]AI & Machine LearningGemini 3.5 Transcribe로 더 똑똑해진 음성-텍스트 변환 (국문)한국의 AI 활용 수준, 글로벌 평균 대비 1.7배 정교…AI 역량이 만드는 일과 교육의 변화 (국문) 딥러닝과 Keras를 이용한 우주 신호 해독 (Decoding cosmic sign
AI 잘 쓰는 사람의 노하우, 어떻게 팀 전체로 퍼질까?
LLM Wiki: 코드 기준으로 자동 최신화되는 도메인 지식 SSOT 만들기
들어가며안녕하세요. LINE Plus에서 Global E-Commerce Platform 개발을 맡고 있는 윤석범입니다.AI로 개발할 때 결과물의 품질은 AI의 코드 생성 능력보다...
AI 시대에도 여전히 중요한 개발자 역량은? K-디지털 트레이닝 멘토링 후기
채용 시장에서 개발자에게 요구하는 기준이 달라지고 있습니다. 얼마 전까지는 ‘AI 도구를 능숙하게 다룰 줄 아는가’ 또는 ‘AI로 코드를 짜본 경험이 있는가’를 강점으로 여겼습니다. 지금은 기준선이 ... Read More