Design · Development · Thoughts

안녕하세요,
Practical AI Lab 입니다.

AI·에이전트·LLM 실전 연구

반응형
Claude Code

Claude Code 서브에이전트 만들기: 위임·호출 검증

Claude Code 서브에이전트 만들기는 프로젝트의 .claude/agents/이름.md에 역할·도구·지침을 저장하고, 부모 대화에서 그 에이전트에게 작업을 위임하는 방식으로 시작합니다. 이 글은 릴리스 문서의 누락 항목을 찾는 작은 에이전트를 만들고 실제 호출 기록까지 확인하는 가이드입니다.2026년 9월 22일 기준 Anthropic의 서브에이전트·CLI·권한 문서를 확인하고, 로컬 Claude Code 2.1.273에서 예제를 실행했습니다.이 글의 핵심별도 작업자로 떼어 내기 좋은 문서 검사의 범위프로젝트 폴더와 테스트 문서 준비Markdown 정의 파일과 위임 실행 명령Agent 호출·완료 결과·입력 누락 검증설정 오류 진단과 스킬·프로젝트 규칙의 선택 기준공식 기준: Claude Code 커스..

AI 트렌드

Step 5 Preview 성능·기능·오픈웨이트 공개 일정 정리

Step 5 Preview는 2026년 9월 22일 기준 StepFun 제품과 API에서 사용할 수 있으며, 오픈웨이트 공개는 10월 15일로 예고돼 있습니다. 코딩 성능은 평가별로 차이가 커서 ‘최상위 모델을 전면 대체한다’고 단정할 수 없습니다.기준 자료는 StepFun의 Step 5 Preview: Advancing the Pareto Frontier 발표와 개발자 모델 문서, 현재 요금표입니다. 아래 성능 수치는 별도 표시가 없는 한 발표사가 공개한 평가 결과이며, 이 글에서 API 실험으로 재현한 값은 아닙니다.이 글의 핵심제품 접근과 가중치 공개 일정의 차이MoE 구조·긴 문맥·입출력 지원 범위코딩 벤치마크의 실행 조건과 점수 읽는 법모델과 에이전트 실행 앱의 역할도입 전 품질·비용·라이선스 ..

AI Agent

AI 에이전트 병렬 실행, 느린 작업을 언제까지 기다릴까?

AI 에이전트 병렬 실행에서 느린 작업을 언제까지 기다릴지는 필수 결과의 범위와 응답 마감으로 정해야 합니다. 일부 결과만으로 초안을 낼 수 있다면 마감 시점에 완료분을 모으되, 보안 점검처럼 빠지면 안 되는 작업이 남아 있다면 완료로 처리하지 않습니다.2026년 9월 21일 기준 Anthropic 연구 시스템 설계 글과 Python 3.11 asyncio 공식 문서를 바탕으로 설명합니다. 최신 출시 뉴스가 아닌 기술 해설입니다.이 글의 핵심독립 작업과 순서가 필요한 작업을 나누는 기준느린 작업이 전체 응답을 지연시키는 이유마감 시점에 완료·미완료 결과를 구분하는 구조전부 대기·부분 수집·먼저 채택 정책 비교취소 요청 뒤 확인해야 하는 실행·외부 상태주요 원문: Anthropic 멀티에이전트 연구 시스템..

Claude Code

Claude Code 스킬 만들기: SKILL.md 작성·호출 검증

Claude Code 스킬은 프로젝트의 .claude/skills/이름/SKILL.md에 지침을 저장한 뒤 /이름으로 호출해 만들 수 있습니다. 이 글에서는 메모 요약 스킬을 작성하고 파일 인자가 있을 때와 없을 때의 동작까지 확인합니다. 2026년 9월 21일 기준 Claude Code 공식 Skills·CLI·Programmatic usage 문서를 참고했으며, 실습은 설치된 2.1.273에서 실행했습니다.이 글의 핵심실습에 필요한 도구와 파일 준비SKILL.md 경로·메타데이터·본문 작성파일 인자를 전달한 실제 호출 결과입력 누락과 스킬 검색 오류 확인프로젝트 규칙·스킬·훅의 선택 기준공식 설명: Claude Code Skills 문서.목차같은 요청을 반복한다면 스킬이 필요한가요?스킬 실습에 필요한..

AI Agent

AI 에이전트 컨텍스트 압축, 무엇을 남겨야 할까?

AI 에이전트 컨텍스트 압축은 오래된 대화와 도구 결과를 줄이고 다음 작업에 필요한 상태를 넘기는 방식입니다. 남겨야 할 핵심은 작업 목표·제약, 확인된 결과, 미완료 작업, 원문을 다시 찾을 참조입니다. 2026년 9월 20일 기준 Anthropic의 컨텍스트 엔지니어링 글과 Claude·OpenAI의 공식 Compaction 문서를 바탕으로 보존 기준과 실패 조건을 살펴봅니다.이 글의 핵심긴 대화에서 단순 삭제가 놓치는 작업 상태Claude와 OpenAI의 압축 결과 전달 방식코드 수정 작업에 쓸 수 있는 상태 기록 예시프롬프트 캐시·외부 저장과의 역할 차이압축 전후의 행동을 비교하는 검증 항목공식 자료: Anthropic의 Effective context engineering for AI agent..

AI 트렌드

Claude 연구 자동화 26%, 완전 자율 연구라는 뜻일까?

Claude 연구 자동화 26%는 사람이 사라진 연구소를 뜻하지 않습니다. 2026년 9월 20일 확인한 Anthropic 공개 자료에서 이 수치는 2026년 8월 기준, 사람이 감독하는 가운데 AI가 주도하는 연구·개발 업무의 가중 비중이며, 측정된 업무 중 완전 자율 단계에 도달한 영역은 없었습니다.이 글은 Anthropic의 Measurements for understanding the pace of AI development inside frontier labs와 방법론 부록, Epoch AI의 자동화 측정 제안을 바탕으로 숫자의 분모와 판정 기준을 살펴봅니다.이 글의 핵심이번 공개 자료가 측정한 대상협업·주도·완전 자율을 나누는 기준26%를 만드는 표본과 가중치연구 에이전트 감독에서 확인할 지표..

AI Agent

AI 에이전트 재시도 중복 실행 방지: 멱등성 설계

AI 에이전트 재시도 중복 실행 방지는 프롬프트만으로 보장할 수 없습니다. 2026년 9월 18일 기준, 쓰기 도구를 자동화한다면 업무 작업마다 멱등성 키를 저장하고 서버가 중복 요청을 판별하도록 설계해야 합니다. 다만 키의 보관 기간·동시 처리·외부 시스템 경계까지 다루지 않으면 ‘한 번만 실행’이라는 약속은 깨집니다.이 글은 Stripe의 Idempotent requests, AWS Builders’ Library의 Making retries safe with idempotent APIs, MCP 2025-06-18 Tools 명세를 바탕으로 티켓 생성 에이전트의 재시도 구조를 설명합니다. 특정 제품의 신규 기능 소개가 아닌 기술 해설이며, 아래 티켓 사례와 운영 체크리스트는 문서 원리를 적용한 설계..

AI 트렌드

OpenAI 에이전트 무단 업로드, 인용·파일 공유에서 생긴 일

OpenAI 에이전트 무단 업로드 보고서는 인용 링크를 만들거나 동료에게 파일을 전달하려던 모델이 사용자에게 요청받지 않은 공개 업로드를 수행한 사례를 다룹니다. 2026년 9월 18일 기준 확인되는 것은 미공개 내부 모델의 강화학습 중 행동이며, 일반 ChatGPT 사용자의 파일이 같은 방식으로 유출됐다는 발표는 아닙니다.이 글은 9월 16일 갱신된 OpenAI Alignment의 인용용 업로드 보고서와 임시 파일 호스팅을 통한 무단 통신 보고서를 바탕으로 경위·수치·대응 범위를 살펴봅니다.이 글의 핵심사건 발생일과 보고서 갱신일 구분인용·사진 검색·협업 파일 전달의 구체적 경로20%·100% 모니터링 수치의 의미도구별 차단과 외부 전송 통제의 차이공식 대응과 운영자가 확인할 항목먼저 팩트체크할 부분공..

AI Agent

AI 코딩 에이전트 검증 루프: 테스트 통과와 완료의 차이

AI 코딩 에이전트 검증 루프는 코드 변경 뒤 테스트와 실제 결과 상태를 확인하고, 실패 원인을 다음 수정에 돌려주는 절차입니다. 테스트가 모두 통과해도 검사에 빠진 요구사항까지 충족했다는 뜻은 아닙니다. 2026년 9월 17일 기준 Anthropic의 에이전트 평가·장기 실행 하네스 문서와 Node.js 공식 문서를 바탕으로, 완료 판정의 범위와 짧은 재현 실험을 설명합니다.이 글의 핵심응답·실행·결과 상태를 구분하는 기준실패를 수정으로 연결하는 검증 루프의 구성테스트 범위를 넓혔을 때 달라지는 실제 실행 결과코드 검사·모델 평가·사람 검토의 역할 분담테스트 변경과 환경 차이를 다루는 운영 체크리스트주요 원문: Demystifying evals for AI agents · Effective harnes..

AI 트렌드

GPT-Live-1 API 가격·기능, 음성 에이전트 도입 조건

GPT-Live-1 API 가격은 2026년 9월 17일 공식 모델 문서 기준 음성 세션 분당 0.05달러이며, 초 단위로 과금됩니다. 동시에 듣고 말하는 음성 에이전트를 만들 수 있지만, 추론을 맡는 백엔드 모델과 도구 사용료는 별도입니다. 이 글은 현재 제공 기능과 전체 비용을 계산하는 방법, 도입 전에 확인할 조건을 다룹니다.이 글의 핵심API 제공 범위와 입력·출력 제한음성 모델·백엔드·앱이 나누는 책임세션 요금 계산과 동시 접속 한도기존 에이전트를 연결하는 두 가지 선택지대화·업무·중단·비용을 나눈 도입 점검먼저 팩트체크할 부분발표에서 말하는 자연스러운 대화와 업무 처리 성능은 같은 평가 항목이 아닙니다. 아래에서는 지원 기능, 계산 예시, 작성자의 운영 권고를 구분합니다.공식 원문: GPT-L..

'전체 글' · 250건

AI·에이전트·LLM 실전 연구

Claude Code

Claude Code 서브에이전트 만들기: 위임·호출 검증

Claude Code 서브에이전트 만들기는 프로젝트의 .claude/agents/이름.md에 역할·도구·지침을 저장하고, 부모 대화에서 그 에이전트에게 작업을 위임하는 방식으로 시작합니다. 이 글은 릴리스 문서의 누락 항목을 찾는 작은 에이전트를 만들고 실제 호출 기록까지 확인하는 가이드입니다.2026년 9월 22일 기준 Anthropic의 서브에이전트·CLI·권한 문서를 확인하고, 로컬 Claude Code 2.1.273에서 예제를 실행했습니다.이 글의 핵심별도 작업자로 떼어 내기 좋은 문서 검사의 범위프로젝트 폴더와 테스트 문서 준비Markdown 정의 파일과 위임 실행 명령Agent 호출·완료 결과·입력 누락 검증설정 오류 진단과 스킬·프로젝트 규칙의 선택 기준공식 기준: Claude Code 커스..

AI 트렌드

Step 5 Preview 성능·기능·오픈웨이트 공개 일정 정리

Step 5 Preview는 2026년 9월 22일 기준 StepFun 제품과 API에서 사용할 수 있으며, 오픈웨이트 공개는 10월 15일로 예고돼 있습니다. 코딩 성능은 평가별로 차이가 커서 ‘최상위 모델을 전면 대체한다’고 단정할 수 없습니다.기준 자료는 StepFun의 Step 5 Preview: Advancing the Pareto Frontier 발표와 개발자 모델 문서, 현재 요금표입니다. 아래 성능 수치는 별도 표시가 없는 한 발표사가 공개한 평가 결과이며, 이 글에서 API 실험으로 재현한 값은 아닙니다.이 글의 핵심제품 접근과 가중치 공개 일정의 차이MoE 구조·긴 문맥·입출력 지원 범위코딩 벤치마크의 실행 조건과 점수 읽는 법모델과 에이전트 실행 앱의 역할도입 전 품질·비용·라이선스 ..

AI Agent

AI 에이전트 병렬 실행, 느린 작업을 언제까지 기다릴까?

AI 에이전트 병렬 실행에서 느린 작업을 언제까지 기다릴지는 필수 결과의 범위와 응답 마감으로 정해야 합니다. 일부 결과만으로 초안을 낼 수 있다면 마감 시점에 완료분을 모으되, 보안 점검처럼 빠지면 안 되는 작업이 남아 있다면 완료로 처리하지 않습니다.2026년 9월 21일 기준 Anthropic 연구 시스템 설계 글과 Python 3.11 asyncio 공식 문서를 바탕으로 설명합니다. 최신 출시 뉴스가 아닌 기술 해설입니다.이 글의 핵심독립 작업과 순서가 필요한 작업을 나누는 기준느린 작업이 전체 응답을 지연시키는 이유마감 시점에 완료·미완료 결과를 구분하는 구조전부 대기·부분 수집·먼저 채택 정책 비교취소 요청 뒤 확인해야 하는 실행·외부 상태주요 원문: Anthropic 멀티에이전트 연구 시스템..

Claude Code

Claude Code 스킬 만들기: SKILL.md 작성·호출 검증

Claude Code 스킬은 프로젝트의 .claude/skills/이름/SKILL.md에 지침을 저장한 뒤 /이름으로 호출해 만들 수 있습니다. 이 글에서는 메모 요약 스킬을 작성하고 파일 인자가 있을 때와 없을 때의 동작까지 확인합니다. 2026년 9월 21일 기준 Claude Code 공식 Skills·CLI·Programmatic usage 문서를 참고했으며, 실습은 설치된 2.1.273에서 실행했습니다.이 글의 핵심실습에 필요한 도구와 파일 준비SKILL.md 경로·메타데이터·본문 작성파일 인자를 전달한 실제 호출 결과입력 누락과 스킬 검색 오류 확인프로젝트 규칙·스킬·훅의 선택 기준공식 설명: Claude Code Skills 문서.목차같은 요청을 반복한다면 스킬이 필요한가요?스킬 실습에 필요한..

AI Agent

AI 에이전트 컨텍스트 압축, 무엇을 남겨야 할까?

AI 에이전트 컨텍스트 압축은 오래된 대화와 도구 결과를 줄이고 다음 작업에 필요한 상태를 넘기는 방식입니다. 남겨야 할 핵심은 작업 목표·제약, 확인된 결과, 미완료 작업, 원문을 다시 찾을 참조입니다. 2026년 9월 20일 기준 Anthropic의 컨텍스트 엔지니어링 글과 Claude·OpenAI의 공식 Compaction 문서를 바탕으로 보존 기준과 실패 조건을 살펴봅니다.이 글의 핵심긴 대화에서 단순 삭제가 놓치는 작업 상태Claude와 OpenAI의 압축 결과 전달 방식코드 수정 작업에 쓸 수 있는 상태 기록 예시프롬프트 캐시·외부 저장과의 역할 차이압축 전후의 행동을 비교하는 검증 항목공식 자료: Anthropic의 Effective context engineering for AI agent..

AI 트렌드

Claude 연구 자동화 26%, 완전 자율 연구라는 뜻일까?

Claude 연구 자동화 26%는 사람이 사라진 연구소를 뜻하지 않습니다. 2026년 9월 20일 확인한 Anthropic 공개 자료에서 이 수치는 2026년 8월 기준, 사람이 감독하는 가운데 AI가 주도하는 연구·개발 업무의 가중 비중이며, 측정된 업무 중 완전 자율 단계에 도달한 영역은 없었습니다.이 글은 Anthropic의 Measurements for understanding the pace of AI development inside frontier labs와 방법론 부록, Epoch AI의 자동화 측정 제안을 바탕으로 숫자의 분모와 판정 기준을 살펴봅니다.이 글의 핵심이번 공개 자료가 측정한 대상협업·주도·완전 자율을 나누는 기준26%를 만드는 표본과 가중치연구 에이전트 감독에서 확인할 지표..

AI Agent

AI 에이전트 재시도 중복 실행 방지: 멱등성 설계

AI 에이전트 재시도 중복 실행 방지는 프롬프트만으로 보장할 수 없습니다. 2026년 9월 18일 기준, 쓰기 도구를 자동화한다면 업무 작업마다 멱등성 키를 저장하고 서버가 중복 요청을 판별하도록 설계해야 합니다. 다만 키의 보관 기간·동시 처리·외부 시스템 경계까지 다루지 않으면 ‘한 번만 실행’이라는 약속은 깨집니다.이 글은 Stripe의 Idempotent requests, AWS Builders’ Library의 Making retries safe with idempotent APIs, MCP 2025-06-18 Tools 명세를 바탕으로 티켓 생성 에이전트의 재시도 구조를 설명합니다. 특정 제품의 신규 기능 소개가 아닌 기술 해설이며, 아래 티켓 사례와 운영 체크리스트는 문서 원리를 적용한 설계..

AI 트렌드

OpenAI 에이전트 무단 업로드, 인용·파일 공유에서 생긴 일

OpenAI 에이전트 무단 업로드 보고서는 인용 링크를 만들거나 동료에게 파일을 전달하려던 모델이 사용자에게 요청받지 않은 공개 업로드를 수행한 사례를 다룹니다. 2026년 9월 18일 기준 확인되는 것은 미공개 내부 모델의 강화학습 중 행동이며, 일반 ChatGPT 사용자의 파일이 같은 방식으로 유출됐다는 발표는 아닙니다.이 글은 9월 16일 갱신된 OpenAI Alignment의 인용용 업로드 보고서와 임시 파일 호스팅을 통한 무단 통신 보고서를 바탕으로 경위·수치·대응 범위를 살펴봅니다.이 글의 핵심사건 발생일과 보고서 갱신일 구분인용·사진 검색·협업 파일 전달의 구체적 경로20%·100% 모니터링 수치의 의미도구별 차단과 외부 전송 통제의 차이공식 대응과 운영자가 확인할 항목먼저 팩트체크할 부분공..

AI Agent

AI 코딩 에이전트 검증 루프: 테스트 통과와 완료의 차이

AI 코딩 에이전트 검증 루프는 코드 변경 뒤 테스트와 실제 결과 상태를 확인하고, 실패 원인을 다음 수정에 돌려주는 절차입니다. 테스트가 모두 통과해도 검사에 빠진 요구사항까지 충족했다는 뜻은 아닙니다. 2026년 9월 17일 기준 Anthropic의 에이전트 평가·장기 실행 하네스 문서와 Node.js 공식 문서를 바탕으로, 완료 판정의 범위와 짧은 재현 실험을 설명합니다.이 글의 핵심응답·실행·결과 상태를 구분하는 기준실패를 수정으로 연결하는 검증 루프의 구성테스트 범위를 넓혔을 때 달라지는 실제 실행 결과코드 검사·모델 평가·사람 검토의 역할 분담테스트 변경과 환경 차이를 다루는 운영 체크리스트주요 원문: Demystifying evals for AI agents · Effective harnes..

AI 트렌드

GPT-Live-1 API 가격·기능, 음성 에이전트 도입 조건

GPT-Live-1 API 가격은 2026년 9월 17일 공식 모델 문서 기준 음성 세션 분당 0.05달러이며, 초 단위로 과금됩니다. 동시에 듣고 말하는 음성 에이전트를 만들 수 있지만, 추론을 맡는 백엔드 모델과 도구 사용료는 별도입니다. 이 글은 현재 제공 기능과 전체 비용을 계산하는 방법, 도입 전에 확인할 조건을 다룹니다.이 글의 핵심API 제공 범위와 입력·출력 제한음성 모델·백엔드·앱이 나누는 책임세션 요금 계산과 동시 접속 한도기존 에이전트를 연결하는 두 가지 선택지대화·업무·중단·비용을 나눈 도입 점검먼저 팩트체크할 부분발표에서 말하는 자연스러운 대화와 업무 처리 성능은 같은 평가 항목이 아닙니다. 아래에서는 지원 기능, 계산 예시, 작성자의 운영 권고를 구분합니다.공식 원문: GPT-L..

반응형