최신 AI 에이전트 플랫폼 20선
on this page
최신 AI 에이전트 플랫폼 20선
오케스트레이션부터 프로토콜까지, 스택으로 읽는 에이전트 생태계
2026년 8월 12일 기준 · 20개 플랫폼 · 6개 계층
에이전트는 답변만 하는 챗봇이 아니라, 목표를 쪼개고 도구를 호출하고 결과를 검증하며 사람이 정한 경계 안에서 실제로 일을 하는 실행 시스템입니다. 2026년의 화두는 “똑똑한 에이전트”가 아니라 **“실패해도 안전한 에이전트”**입니다.
01. 2026년 4가지 트렌드
① 프레임워크 대통합 — 2026년 4월 Microsoft Agent Framework 1.0 출시로 AutoGen과 Semantic Kernel이 통합됐습니다. 지금 고른 프레임워크가 2년 뒤에도 살아남는다는 보장이 없다는 뜻이라, “떠나기 쉬운 설계”(표준 프로토콜로 도구 연결, 로직은 프레임워크 밖에)가 중요해졌습니다.
② 프로토콜 전쟁 종료 — MCP(도구 연결)와 A2A(에이전트 간 협업)가 경쟁이 아니라 서로 다른 층을 담당하는 보완재로 정리됐습니다. 둘 다 Linux Foundation 산하로 이관됐고, MCP는 월 9,700만 건 SDK 다운로드·1.8만 개 공개 서버 규모입니다.
③ 진짜 병목은 추론이 아니라 인증 — 브라우저 에이전트 벤치마크(WebBench) 최고 성적은 64.4%. 실패 대부분이 로그인·2FA에서 발생합니다. 같은 프로젝트라도 오픈소스 라이브러리와 관리형 클라우드 점수 차이가 30포인트 이상 나기도 합니다(browser-use: 63.3% vs 97%).
④ 개인 에이전트 대중화 + 보안 부채 — OpenClaw는 GitHub 스타 38만 개를 넘겼지만, 광범위한 권한 요구·프롬프트 인젝션 취약성이 실제 사고(데이터 유출 스킬 발견)로 드러났습니다.
에이전트의 성패는 모델이 얼마나 똑똑한지가 아니라, 실패했을 때 무엇이 망가지는지를 미리 정해 뒀는가에서 갈립니다.
02. 선정 기준 & 핵심 용어
선정 기준 3가지 — ① 실행 가능성(실제로 API·브라우저·터미널을 호출하는가) ② 운영 가능성(로그·재시도·비용추적이 되는가) ③ 탈출 가능성(벤더 락인 없이 갈아탈 수 있는가)
꼭 알아야 할 용어
- 에이전트 : 도구 호출 → 결과 확인 → 다음 행동 결정을 반복(에이전틱 루프)하며 목표에 도달하는 시스템
- 오케스트레이션 : 여러 단계·조건 분기·재시도·승인을 하나의 흐름으로 통제하는 일
- HITL(Human-in-the-Loop) : 되돌리기 어려운 행동 전에 사람 승인을 받는 설계
- MCP : 에이전트-도구/데이터 연결 표준 (2026년 Linux Foundation 관리)
- A2A : 에이전트끼리 서로 발견하고 일을 위임하는 표준
- 프롬프트 인젝션 : 웹페이지·문서에 숨긴 명령으로 에이전트를 조종하는 공격 (완전한 방어책 없음, 권한 최소화가 유일한 대책)
- 관측성·트레이스 : 모든 LLM 호출·도구 실행 기록. 에이전트는 조용히 실패하므로 필수
- RPA와의 차이 : RPA는 절차 고정, 에이전트는 목표만 주고 절차는 매번 판단
03. 계층별 20선
Layer 1 — 오케스트레이션 프레임워크
| 프로젝트 | 라이선스 | ★ | 한줄 요약 |
|---|---|---|---|
| langchain-ai/langgraph | MIT | 38.1k | 상태 머신 기반 오케스트레이션의 사실상 표준. 체크포인트·재개·승인 개입 내장. 파이썬 진영 기본값 |
| microsoft/agent-framework | MIT | 12.6k | AutoGen+Semantic Kernel 후계. .NET/Python 동등 지원, Azure 스택에 유리 |
| openai/openai-agents-python | MIT | 26.3k | 에이전트·도구·핸드오프·가드레일 4개 개념만. 100+ 모델 제공자 지원, 빠른 프로토타입용 |
| google/adk-python | Apache-2.0 | 19.6k | 디버깅 UI 내장, A2A 선도 진영. GCP·Gemini 환경에 적합 |
LangChain(13.4만★)은 통합 생태계는 넓지만, 오케스트레이션 역할은 이제 LangGraph로 넘어갔습니다.
Layer 2 — 역할 분업 & 언어별 선택지
| 프로젝트 | 라이선스 | ★ | 한줄 요약 |
|---|---|---|---|
| crewAIInc/crewAI | MIT | 56.9k | 역할 기반 멀티에이전트, 개념이 직관적. 비동기·비 OpenAI 안정성은 운영 전환 시 재검토 |
| mastra-ai/mastra | Apache 2.0+EE | 23.9k | TypeScript 네이티브 올인원 프레임워크. React/Next.js 팀에 유력 |
| huggingface/smolagents | Apache-2.0 | 27.3k | 코드 실행으로 동작하는 1,000줄 미니멀 에이전트. 샌드박스 필수 |
역할을 늘리면 토큰 비용·지연·실패 지점이 함께 늘어납니다. 분업이 실제로 이득인지 먼저 측정하세요.
Layer 3 — 코딩 에이전트
| 프로젝트 | 라이선스 | ★ | 한줄 요약 |
|---|---|---|---|
| All-Hands-AI/OpenHands | MIT | 83.7k | Claude Code·Codex 등 ACP 호환 에이전트를 함께 운영하는 셀프호스팅 관제탑 |
| cline/cline | Apache-2.0 | 63.9k | 매 단계 승인 기본값. IDE 네이티브, 통제된 협업형 |
| Aider-AI/aider | Apache-2.0 | 48.1k | 변경마다 자동 Git 커밋. 되돌리기 비용 거의 0, 진입장벽 가장 낮음 |
| SWE-agent/SWE-agent | MIT | 20.0k | 이슈 해결 루프 원형을 보여주는 연구용 레퍼런스 |
테스트 통과라는 성공 기준과 Git이라는 되돌리기 장치가 이미 있어 에이전트를 실전에 올리기 가장 좋은 영역입니다.
Layer 4 — 브라우저·컴퓨터 사용 에이전트
| 프로젝트 | 라이선스 | ★ | 한줄 요약 |
|---|---|---|---|
| browser-use/browser-use | MIT | 108.1k | 목표만 주면 제어 루프를 직접 돌리는 가장 큰 커뮤니티. 라이브러리(63.3%)/클라우드(97%) 점수 차이 확인 필수 |
| browserbase/stagehand | MIT | 22.6k | Playwright + AI 비상구 하이브리드. 개발자가 제어 루프 유지 |
| Skyvern-AI/skyvern | AGPL-3.0⚠ | 21.6k | 비전 기반 화면 해석, 2FA 지원. 상업 이용은 법무 검토 필수 |
최고 성적이 60%대에 머물고 실패 다수가 로그인·2FA에서 발생합니다. 되돌릴 수 있는 읽기 작업부터 시작하세요. (도구만 필요하면 microsoft/playwright-mcp도 대안)
Layer 5 — 노코드 빌더 & 개인 에이전트
| 프로젝트 | 라이선스 | ★ | 한줄 요약 |
|---|---|---|---|
| langgenius/dify | Dify OSS⚠ | 142k | 워크플로+지식베이스+배포 올인원. PoC-운영 간격이 가장 좁음 |
| n8n-io/n8n | fair-code⚠ | 198.3k | 400+ 연동으로 에이전트를 사내 시스템에 꽂는 접착제 |
| openclaw/openclaw | MIT | 386k | 메신저 인터페이스 개인 상주 에이전트 |
⚠ OpenClaw 주의 : 광범위한 권한 요구 + 프롬프트 인젝션 취약성이 실제 데이터 유출 사고로 확인됐습니다. 업무용은 권한이 통제되는 플랫폼(Dify·n8n 등)을 쓰고, 개인 실험은 격리된 환경에서만.
Layer 6 — 런타임 인프라: 프로토콜·메모리·관측성
| 프로젝트 | 라이선스 | ★ | 한줄 요약 |
|---|---|---|---|
| modelcontextprotocol/servers | Apache-2.0/MIT | 86.7k | 도구 연동 표준 MCP 참조 서버 모음. 사내 시스템 연결 시 최우선 |
| mem0ai/mem0 | Apache-2.0 | 62.8k | 세션 이후에도 남는 장기 메모리 레이어 |
| langfuse/langfuse | MIT(ee 별도) | 32.4k | 트레이스·비용·품질 점수 관측성 계층. 노출 전부터 필요 |
PoC가 서비스로 넘어갈 때 가장 자주 빠지는 계층입니다. 에이전트는 조용히 실패하기 때문에 트레이스 없이는 원인 재현이 불가능합니다.
04. 목적별 스택 조합 4가지
| 과제 | 조합 |
|---|---|
| ① 개발팀 유지보수 자동화 (가장 안전) | Cline/Aider → OpenHands → MCP → Langfuse |
| ② 사내 업무 자동화 (비개발자 참여형) | Dify → n8n → LangGraph → Langfuse |
| ③ 웹 리서치·데이터 수집 | browser-use/Stagehand → LangGraph → Mem0 → Langfuse |
| ④ 고객 대면 에이전트 (가장 늦게) | LangGraph/Agent Framework → 가드레일 → Mem0 → Langfuse(필수) |
공통 원칙: 되돌리기 쉬운 작업부터, 관측성은 처음부터.
05. 도입 전 체크리스트
- 되돌릴 수 있는 작업부터 시작했는가
- 에이전트 전용 계정·최소 권한을 부여했는가
- 코드·명령 실행을 격리했는가 (네트워크 차단·시간 제한·파일시스템 격리)
- 프롬프트 인젝션을 전제로 설계했는가
- 비용 상한·루프 차단 장치가 있는가
- 트레이스를 처음부터 남기고 있는가
- 실패를 감지할 검증 단계가 있는가
- 라이선스(AGPL·fair-code·이중 라이선스)가 사업 모델과 맞는가
06. 자주 묻는 질문
Q. 멀티에이전트가 항상 더 나은가요? — 아니요. 역할을 늘리면 비용·지연·실패 지점이 함께 늘어납니다. “맥락 과부하”가 원인이면 분업이 도움되지만, “도구 부실”이 원인이면 에이전트를 늘려도 똑같이 실패합니다.
Q. 프레임워크 없이 직접 짜도 되나요? — 단일 루프 수준이면 직접 짜는 게 빠릅니다. 상태 지속·재개·승인 개입·병렬 실행이 필요해지는 순간부터 프레임워크가 값을 합니다. 도구 연결만은 처음부터 MCP를 쓰세요.
Q. 에이전트가 실패하는 진짜 원인은? — 추론 부족이 아니라, 브라우저 영역은 로그인·2FA, 일반 업무는 모호한 도구 오류 메시지입니다. 더 큰 모델보다 도구 출력 형태를 먼저 점검하세요.
Q. MCP와 A2A 둘 다 필요한가요? — 대부분 MCP만으로 충분. A2A는 여러 조직의 에이전트가 서로 발견·위임해야 할 때만 필요합니다.
Q. 목록에 없지만 검토할 만한 것은? — LangChain, Langflow·Flowise, LlamaIndex Workflows, Deep Agents, Opik·Arize Phoenix, Letta·Zep, E2B·Daytona, playwright-mcp, Temporal.
마무리
부품은 충분히 성숙했고, 이제 문제는 경계 설정입니다. 대부분의 에이전트 프로젝트가 데모에서 멈추는 이유는 성능이 아니라 로그인 실패, 모호한 오류, 조용한 오답, 재현 불가능한 실패 때문입니다. 더 큰 모델로 해결되지 않습니다.
가장 강력한 플랫폼을 찾기보다, 업무 하나를 정하고 실패했을 때 무엇이 망가지는지 먼저 정의하세요. 되돌리기 쉬운 작업에서 시작해 성공률·비용·검토 시간을 측정하고 권한을 한 칸씩 넓히는 것이 정답입니다.
작성 기준일 2026년 8월 12일 · 스타/포크 수치는 실시간이 아닌 수집 시점 값 · ⚠는 상업 이용 전 라이선스 원문 확인 필요 · 법적 조언 아님