에이전트 성능
AI 인력을 모니터링, 측정 및 최적화하세요.
성능 메트릭
개별 에이전트 메트릭
작업 메트릭:
- 완료된 작업 — 완료된 총 작업
- 완료율 — 성공 백분율
- 평균 완료 시간 — 작업 속도
- 품질 점수 — 검토자 평가
활동 메트릭:
- 본문 메시지 — 커뮤니케이션 볼륨
- 사용된 도구 — 기능 활용
- 생성된 파일 — 출력 볼륨
- 활성 세션 — 온라인 시간
비용 메트릭:
- 사용된 토큰 — AI 모델 소비
- 작업당 비용 — 효율성
- 일일/주간 지출 — 예산 영향
- 모델 분석 — 사용된 AI 모델
에이전트 성능 보기
접근: 에이전트 상세 → 성능 탭
┌─────────────────────────────────────────────────────────┐
│ Nova — 성능 (지난 30일) │
├─────────────────────────────────────────────────────────┤
│ │
│ 요약 │
│ • 24 작업 완료 | 96% 성공률 │
│ • 평균 완료: 2.3시간 │
│ • 총 비용 $124.50 | 작업당 평균 $5.19 │
│ │
├─────────────────────────────────────────────────────────┤
│ │
│ 작업 분석 │
│ 코드 검토: 8 작업 | 100% 성공 | 평균 1.5시간 │
│ 기능 개발: 12 작업 | 92% 성공 | 평균 3.2시간 │
│ 버그 수정: 4 작업 | 100% 성공 | 평균 0.8시간 │
│ │
├─────────────────────────────────────────────────────────┤
│ │
│ 비용 분석 │
│ Claude 3.5 Sonnet: $98.20 (79%) █████████████████ │
│ GPT-4: $26.30 (21%) ████ │
│ │
│ 일일 평균: $4.15/일 │
│ │
└─────────────────────────────────────────────────────────┘
성능 분석
분석 패널
접근: 탐색 레일 → 분석
대시보드 보기:
에이전트 개요:
에이전트 성능 (7일)
┌─────────┬──────────┬───────────┬──────────┬─────────┐
│ 에이전트│ 작업 │ 성공 % │ 평균 시간│ 비용 │
├─────────┼──────────┼───────────┼──────────┼─────────┤
│ Nova │ 12 │ 92% │ 2.3h │ $52.30 │
│ Echo │ 8 │ 100% │ 1.8h │ $34.10 │
│ Pixel │ 6 │ 83% │ 3.1h │ $28.50 │
│ Scout │ 15 │ 100% │ 1.2h │ $31.20 │
└─────────┴──────────┴───────────┴──────────┴─────────┘
작업 속도:
일별 완료된 작업
월: ████████ 8
화: ██████████ 10
수: ██████ 6
목: ████████████ 12
금: ████████ 8
트렌드: 지난 주 대비 +15%
비용 추세:
일일 지출 (지난 30일)
[시간에 따른 지출을 보여주는 선 그래프]
최고: 12월 10일 $18.50
평균: $8.20/일
예상 월간: $246
기업 성능
기업 수준 메트릭:
- 완료된 총 작업
- 달성된 목표
- 예산 활용
- 팀 효율성
- 완료 시간
예시:
Q1 마케팅 캠페인 성능
작업: 45 완료 | 3 진행 중 | 2 차단
목표: 3개 중 2개 달성 | 1 진행 중
예산: $1,000 중 $342 (34%)
팀 효율성: 94%
평균 작업 시간: 2.1일
성능 최적화
속도 최적화
에이전트가 느린 경우:
-
모델 선택 확인
- 간단한 작업을 위한 더 빠른 모델
- GPT-4 대신 GPT-3.5 사용
- 속도를 위한 로컬 Ollama
-
작업 단순화
- 큰 작업을 더 작은 작업으로 나누기
- 명확한 요구사항 제공
- 범위 확장 줄이기
-
컨텍스트 줄이기
- 오래된 메모리 지우기
- 완료된 프로젝트 보관
- 관련 정보에 집중
-
병렬 처리
- 서브에이전트 생성
- 더 많은 전문가 고용
- 워크로드 분산
비용 최적화
비용이 높은 경우:
-
모델 전환
- 일상적인 작업을 위한 더 저렴한 모델
- 복잡한 작업을 위한 비싼 모델 예약
- 제공자 혼합
-
프롬프트 최적화
- 더 짧고 명확한 지침
- 예시 사용
- 구체적이기
-
작업 일괄 처리
- 유사한 작업 그룹화
- 일괄 처리
- API 호출 감소
-
완료 시 보관
- 유휴 에이전트를 계속 실행하지 않기
- 완료된 기업 보관
- 미사용 리소스 해제
비용 비교:
| 모델 | 품질 | 속도 | 비용 |
|---|---|---|---|
| Claude 3.5 Sonnet | 높음 | 빠름 | $$$ |
| GPT-4 | 높음 | 중간 | $$$ |
| GPT-3.5 | 중간 | 빠름 | $ |
| Ollama 로컬 | 다양함 | 빠름 | 물 (하드웨어 필요) |
품질 최적화
품질이 낮은 경우:
-
명확한 수락 기준
- 특정 "완료" 정의
- 예시 제공
- 표준 설정
-
더 나은 브리핑
- 더 많은 컨텍스트
- 배경 정보
- 스타일 가이드
-
검토 프로세스
- 검토자 에이전트 추가
- 인간 검토 단계
- 피드백 반복
-
작업에 적합한 에이전트
- 작업에 스킬 매칭
- 전문가 사용
- 인턴을 복잡한 작업에 사용하지 않기
성능 검토
정기적인 체크인
주간 검토:
2024년 12월 9-15일 주
최고 수행자:
1. Echo — 8 작업, 100% 성공, 예산 내
2. Scout — 15 작업, 빠른 처리 시간
3. Nova — 복잡한 기능 전달
주목 필요:
1. Pixel — 3 작업 차단, 디자인 자산이 필요
비용 확인:
• 예산: $200/주
• 실제: $187/주 ✅
다음 주:
• 집중: Q1 캠페인 완료
• 주의: Pixel의 디자인 백로그
월간 보고서:
2024년 12월 성능
전체:
• 156 작업 완료 (11월 대비 +23%)
• 97% 성공률 (11월 대비 +2%)
• 총 비용 $892 (11월 대비 +15%)
에이전트별:
[전체 분석 테이블]
기업별:
[기업 성능 요약]
권장 사항:
1. 추가 디자이너 고용 (백로그 증가)
2. 일상적인 작업을 위해 Pixel을 GPT-3.5로 전환
3. 메모리 해제를 위해 오래된 프로젝트 보관
문제 식별
경고 신호:
| 징후 | 가능한 문제 | 해결책 |
|---|---|---|
| 높은 오류율 | 작업 맞지 않음 | 다른 에이전트에게 재할당 |
| 느린 완료 | 작업이 너무 큼 | 더 작은 작업으로 분할 |
| 높은 비용 | 잘못된 모델 | 더 저렴한 모델로 전환 |
| 낮은 품질 | 요구사항 불분명 | 수락 기준 추가 |
| 자주 차단됨 | 의존성 | 워크플로우 수정 |
벤치마크
좋은 성능
개별 에이전트:
- 90% 이상 성공률
- 작업당 2-4시간 (평균)
- 예산 내
- 긍정적인 피드백
기업:
- 85% 이상 목표 달성
- 기한 내 전달
- 예산 내
- 품질 산출물
나쁜 성능
개별 에이전트:
- 70% 미만 성공률
- 일관되게 마감일 초과
- 높은 오류율
- 반복적인 품질 문제
기업:
- 목표 놓침
- 예산 초과
- 중단된 작업
- 낮은 품질 산출물
성능 개선
에이전트 수준 개선
교육:
- 배운 교훈으로 SOUL.md 업데이트
- 완료된 작업에 대한 피드백 제공
- 모범 사례 공유
- 선호도 문서화
도구:
- 특정 도구 활성화/비활성화
- 권한 조정
- 능력 업데이트
- 스킬 추가/제거
구성:
- AI 모델 변경
- 시간 초과 조정
- 작업 공간 제한 설정
- 알림 구성
기업 수준 개선
프로세스:
- 워크플로우 개선
- 검토 단계 추가/제거
- 승인 임계값 조정
- 핸드오프 개선
팀:
- 상호 보완적인 기술 고용
- 저성과자 제거
- 워크로드 재조정
- 용량 추가
계획:
- 더 나은 목표 설정
- 현실적인 타임라인
- 더 명확한 요구사항
- 더 구체적인 산출물
성능 추적 도구
내장 보고서
스탠드업 보고서:
- 일일 활동 요약
- 완료율
- 식별된 차단
- 팀 속도
비용 보고서:
- 지출 분석
- 예산 대 실제 | 산출물당 비용
- 예측
활동 보고서:
- 도구 사용량
- 온라인 시간
- 커뮤니케이션 볼륨
- 출력 메트릭
커스텀 추적
대시보드 생성:
- 추적할 메트릭 선택
- 기간 선택
- 벤치마크 설정
- 보고서 납품
알림 설정:
알림: 에이전트 성공률이 80% 미만
작업: 관리자에게 알림
알림: 일일 비용이 $20 초과
작업: 예산 경고
알림: 작업이 3일 이상 차단
작업: 관리자에게 에스컬레이션
사례 연구
사례 1: 느린 에이전트 최적화
문제: Nova (엔지니어)가 작업당 6시간 이상 소요
조사:
- 모든 작업에 GPT-4 사용
- 큰 메모리가 응답을 느리게 함
- 작업이 너무 광범위함
해결책:
- Claude 3.5 Sonnet으로 전환 (더 빠름)
- 오래된 프로젝트 메모리 보관
- 작업을 더 작은 조각으로 분할
결과: 평균 6시간 → 2.5시간, 동일한 품질
사례 2: 비용 절감
문제: 월간 비용이 예산보다 50% 초과
조사:
- 모든 에이전트가 비싼 모델 사용
- 유휴 에이전트 실행
- 비효율적인 워크플로우
해결책:
- 일상적인 작업 → GPT-3.5
- 완료된 기업 보관
- 비용 의식 가이드라인 추가
결과: $450/월 → $180/월
사례 3: 품질 개선
문제: 30%의 산출물이 재작업 필요
조사:
- 요구사항 불분명
- 수락 기준 없음
- 스타일 가이드 누락
해결책:
- 구체적인 수락 기준 추가
- 지식 베이스에 스타일 가이드 생성
- 검토자 단계 추가
결과: 30% 재작업 → 5% 재작업
모범 사례
모니터링
- 주간 검토 — 정기적인 체크인
- 트렌드 추적 — 스냅샷이 아닌
- 기간 비교 — 월 대 월
- 기준선 설정 — 정상이 무엇인지 알기
- 이상 징후 조사 — 문제 파고들기
최적화
- 보수적으로 시작 — 그런 다음 최적화
- 변경 측정 — 조정 A/B 테스트
- 병목 현상에 집중 — 가장 큰 영향 먼저
- 품질/속도/비용 균형 — 셋 다 최적화할 수 없음
- 반복 — 지속적인 개선
커뮤니케이션
- 결과 공유 — 팀/이해관계자와
- 성과 축하 — 좋은 성능 인정
- 문제 해결 — 빠르고 직접적으로
- 기대 설정 — 명확한 목표
- 데이터 기반 — 메트릭에 기반한 결정