본문 바로가기

AI Agent9

DoT (Division of Thoughts) Division-of-Thoughts, 라우팅 단위를 질문에서 subtask로 내리면요약온디바이스 에이전트에는 근본 딜레마가 있습니다. 클라우드 LLM은 강하지만 비싸고 느리고 데이터가 밖으로 나가고, 로컬 SLM은 싸고 빠르지만 복잡한 추론에서 약합니다.기존 접근은 질문 전체를 둘 중 하나에 통째로 보냅니다. 그래서 "쉬운 부분까지 비싼 모델에 보내는" 낭비가 생깁니다.DoT의 출발점은 관찰 하나입니다. 한 질문 안에서도 부분마다 난이도가 다릅니다.이 논문의 기여 셋. ① 라우팅 단위를 질문에서 subtask로 내렸다는 게 진짜 기여입니다. ② 배정 경계를 사람 주석 없이 자기강화로 학습합니다. ③ 정확도를 일부 내줍니다.결과는 7개 벤치마크에서 평균 시간 66.12% 감소, API 비용 83.57% .. 2026. 8. 11.
에이전트 프레임워크 (LangChain, LangGraph, CrewAI, AutoGen, n8n) 에이전트 프레임워크 비교, LangChain, LangGraph, CrewAI, AutoGen, n8n요약다섯 개를 나란히 놓으면 같은 층에 있지 않습니다. LangChain은 컴포넌트 라이브러리, LangGraph는 그 아래의 실행 엔진, CrewAI는 역할 기반 오케스트레이터, Microsoft Agent Framework는 엔터프라이즈 런타임, n8n은 워크플로 자동화 도구입니다. 먼저 층을 맞춰야 비교가 성립합니다.가장 중요한 갈림길은 누가 흐름을 정하느냐입니다. LangGraph는 개발자가 그래프로 못 박고, CrewAI Crews는 에이전트에게 위임하고, n8n은 사람이 캔버스로 그립니다. 이 선택이 디버깅 난이도와 재현성을 통째로 결정합니다.AutoGen은 끝났습니다. 공식 저장소가 유지보수.. 2026. 2. 22.
MCP 보안 MCP 보안, 도구를 위임하는 순간 열리는 새 공격면요약MCP는 LLM을 외부 도구와 데이터에 붙이는 표준입니다. 그런데 임의의 서버에 도구 실행을 위임하는 구조라, 기존에 없던 공격면이 열립니다.위협은 다섯입니다. 악성 도구 설명으로 모델을 조종하는 tool poisoning, 도구 결과에 숨은 지시가 모델을 탈취하는 간접 프롬프트 인젝션, 과도 권한과 토큰 패스스루, 권한 있는 중개자를 속이는 confused deputy, 그리고 서버 공급망입니다.왜 새로운가 하면, 사용자에게 안 보이고 모델에게만 보이는 메타데이터가 컨텍스트에 들어가고, 서버가 사용자를 대신해 실행까지 합니다. 프롬프트 인젝션과 권한 위임, 공급망이 한자리에 모입니다.가장 흔한 오해. "도구 결과만 조심하면 된다"는 틀렸습니다. 도.. 2026. 2. 13.
MCP (Model Context Protocol) MCP 완전 정리, LLM에 도구를 꽂는 개방 표준요약MCP는 LLM 앱과 외부 도구, 데이터를 잇는 개방 표준 프로토콜입니다. JSON-RPC 2.0 메시지로 통신하고, Anthropic이 2024년 11월에 발표하며 오픈소스로 공개했습니다.존재 이유가 한 줄로 정리됩니다. 앱 N개와 도구 M개를 매번 따로 붙이면 통합이 N 곱하기 M으로 폭증합니다. 공통 프로토콜이면 N 더하기 M으로 줄어듭니다.구조는 호스트, 클라이언트, 서버 세 역할입니다. 호스트가 서버마다 클라이언트를 하나씩 띄워 1대1 전용 연결을 맺습니다.서버가 노출하는 건 셋입니다. Tools(행동), Resources(읽기 컨텍스트), Prompts(템플릿). 서버가 스스로 자기 도구를 설명하기 때문에 호스트가 서버 코드를 미리 알 필요.. 2026. 1. 29.
Reflexion Reflexion 완전 정리, 가중치 대신 메모리를 갱신하는 강화학습요약LLM 에이전트가 시행착오로 배우려면 보통 강화학습으로 가중치를 다시 학습해야 합니다. 학습 샘플이 많이 들고 파인튜닝 비용이 비쌉니다.Reflexion의 아이디어는 이겁니다. 가중치를 건드리지 말고, 실패를 언어로 복기해 메모리에 적어두고 다음 시도의 프롬프트로 다시 읽게 하자. 논문은 이를 verbal reinforcement learning이라 부릅니다.진짜 기여는 학습 신호를 스칼라 보상에서 자연어 성찰로 바꾼 것입니다. 보상 숫자 하나 대신 "왜 틀렸고 다음엔 뭘 바꿔라"라는 문장을 다음 시도의 컨텍스트에 넣습니다.구조는 셋입니다. Actor(시도), Evaluator(채점), Self-Reflection(복기)이 에피소드 .. 2025. 10. 19.
Plan and Solve Plan-and-Solve 완전 정리, 프롬프트 한 줄로 단계 누락 줄이기요약예시 없이 쓰는 zero-shot 프롬프팅 기법입니다. "Let's think step by step"을 한 단계 발전시켜, 먼저 계획을 세우고 그 계획대로 실행하게 시킵니다.문제의식이 구체적입니다. zero-shot CoT는 계산 오류, 단계 누락, 의미 오해 세 가지로 틀리는데, 그중 단계 누락을 정조준합니다.기법은 둘로 나뉩니다. PS는 계획 후 실행으로 단계 누락을, PS+는 거기에 변수 추출과 중간 계산 기록을 더해 계산 오류까지 겨냥합니다.가장 강한 결과는 이겁니다. 수학 추론에서 예시 8개를 준 8-shot CoT에 필적했습니다. 손으로 예시를 만들지 않고도 few-shot급에 근접했다는 뜻입니다.실무적 매력은 비용.. 2025. 10. 5.
Native Tool Calling 네이티브 도구 호출 완전 정리, 호출을 텍스트에서 떼어내면요약네이티브 도구 호출은 "어떤 함수를 어떤 인자로 부를지"를 자유 텍스트가 아니라 별도의 구조화된 필드로 내보내는 방식입니다. 핵심은 한 문장입니다. 호출을 텍스트에서 떼어내 구조로 만든다.기본 단위는 왕복입니다. 앱이 스키마를 넘기고, 모델이 구조화 호출을 만들고, 앱이 실제 실행하고, 결과를 다시 모델에 되돌립니다. 모델 호출 2번 사이에 우리 코드의 실행 1번이 낍니다.가장 흔한 오해. 네이티브가 더 똑똑한 게 아닙니다. 네이티브는 인터페이스 구현 방식이지 추론력 자체가 아닙니다.두 번째 오해. 네이티브라고 인자 JSON이 항상 맞는 건 아닙니다. 보장하려면 제약 디코딩(strict)이 따로 필요하고, 이건 병렬 호출과 상충합니다.제공사마다.. 2025. 5. 28.
ReWOO: Decoupling Reasoning from Observations for Efficient Augmented Language Models ReWOO 완전 정리, 추론을 관찰에서 떼어내면요약ReWOO는 도구를 쓰는 에이전트에서 추론(계획)을 중간 관찰과 분리하는 패턴입니다. 도구 호출을 매번 반응하며 하지 않고 처음에 전체 계획을 한 번에 세웁니다.문제 설정이 날카롭습니다. ReAct처럼 관찰을 끼워 넣으면 관찰이 하나 올 때마다 직전까지의 전체 문맥을 다시 LLM에 밀어 넣어야 해서 토큰이 눈덩이처럼 커집니다.이걸 가능하게 하는 트릭이 증거 자리표시자 #E1, #E2입니다. 아직 모르는 도구 결과를 변수처럼 두고 뒤 단계가 참조하니, 의존 관계가 있는 다단계 작업도 중간 재호출 없이 이어집니다.결과적으로 LLM 호출이 도구 개수와 무관하게 계획 1회와 종합 1회, 총 2회로 고정됩니다.논문 초록 기준으로 HotpotQA에서 토큰 효율 5배.. 2024. 10. 14.
ReAct (Reasoning + Acting) ReAct 완전 정리, 추론과 행동을 번갈아 하면 무엇이 달라지나요약ReAct는 Thought와 Action을 번갈아 생성하고, 행동의 결과인 Observation을 다음 추론에 반영하는 에이전트 루프입니다. 이름 자체가 Reasoning + Acting입니다.문제 설정이 명확합니다. 추론만 하면 외부 사실을 못 끌어와 환각에 취약하고, 행동만 하면 무엇을 왜 할지 계획이 없습니다.논문의 표현으로는 "추론 흔적은 행동 계획을 세우고 추적하고 갱신하며 예외를 다루게 돕고, 행동은 외부 소스와 접속해 추가 정보를 모으게 한다"입니다. 양방향입니다.가장 중요한 사실. ReAct는 모델이 아니라 패턴입니다. 새 모델을 학습시키는 게 아니라 같은 LLM에게 형식을 반복하도록 시키는 프롬프팅이자 제어 방식입니다.결.. 2024. 2. 5.