AgentLens — 코딩 에이전트 평가를 위한 실전 궤적 리뷰
원제: AgentLens: Production-Assessed Trajectory Reviews for Coding Agent Evaluation
저자는 인터랙티브 코드 에이전트를 위한 실전 평가 벤치마크 AgentLens를 제시합니다. 기존 코드 에이전트 벤치마크는 작업 성공 여부(0/1) 하나로 평가하지만, 실제 사용자는 전체 궤적의 품질을 경험합니다. AgentLens는 실제 배포 환경에서 평가한 궤적 리뷰를 제공합니다.
1. 한줄 요약
AgentLens — 코딩 에이전트 평가를 위한 실전 궤적 리뷰 — 상세 리뷰 준비 중. 요약은 summaryKo 필드를 참고하세요.
2. 키워드
- 주제: agent
- 중요도: 6
- 출처: arXiv cs.AI
🚀 이 기술领域의 스타트업
이 논문의 주제(Agent)와 같은 R&D 영역의 미국 스타트업
ElevenLabs
New York, NY · 2022
Generative voice AI — 음성 복제·합성·번역·감정, 29개 언어, 0.5초 내 latency
Sierra AI
San Francisco, CA (본사) + New York, Atlanta, London, Singapore, Tokyo, Paris, Madrid, Toronto (글로벌 오피스) · 2023
**Conversational AI agent OS** — outcomes-based pricing (pay for results, not tokens). 채널 통합 (chat, SMS, WhatsApp, email, voice, ChatGPT). 다국어·다채널 production-ready agent 자동 빌드 (SOPs·transcripts·whiteboard → Ghostwriter). Agent Studio로 no-code/low-code 빌드 + 통계 검증 가능한 Experiments. Agent Data Platform으로 customer context 영구화. Horizon으로 days~weeks 장기 호라이즌 계획. STAR Level One security. STAR 인증 trust badge.
Suno
Cambridge, MA · 2023
Generative music AI — 텍스트 한 줄로 4분 풀 곡 생성, 보컬 포함, 2024년 12월 v4 출시