AI Agent/Patterns5 DoT (Division of Thoughts) Division-of-Thoughts, 라우팅 단위를 질문에서 subtask로 내리면요약온디바이스 에이전트에는 근본 딜레마가 있습니다. 클라우드 LLM은 강하지만 비싸고 느리고 데이터가 밖으로 나가고, 로컬 SLM은 싸고 빠르지만 복잡한 추론에서 약합니다.기존 접근은 질문 전체를 둘 중 하나에 통째로 보냅니다. 그래서 "쉬운 부분까지 비싼 모델에 보내는" 낭비가 생깁니다.DoT의 출발점은 관찰 하나입니다. 한 질문 안에서도 부분마다 난이도가 다릅니다.이 논문의 기여 셋. ① 라우팅 단위를 질문에서 subtask로 내렸다는 게 진짜 기여입니다. ② 배정 경계를 사람 주석 없이 자기강화로 학습합니다. ③ 정확도를 일부 내줍니다.결과는 7개 벤치마크에서 평균 시간 66.12% 감소, API 비용 83.57% .. 2026. 8. 11. Reflexion Reflexion 완전 정리, 가중치 대신 메모리를 갱신하는 강화학습요약LLM 에이전트가 시행착오로 배우려면 보통 강화학습으로 가중치를 다시 학습해야 합니다. 학습 샘플이 많이 들고 파인튜닝 비용이 비쌉니다.Reflexion의 아이디어는 이겁니다. 가중치를 건드리지 말고, 실패를 언어로 복기해 메모리에 적어두고 다음 시도의 프롬프트로 다시 읽게 하자. 논문은 이를 verbal reinforcement learning이라 부릅니다.진짜 기여는 학습 신호를 스칼라 보상에서 자연어 성찰로 바꾼 것입니다. 보상 숫자 하나 대신 "왜 틀렸고 다음엔 뭘 바꿔라"라는 문장을 다음 시도의 컨텍스트에 넣습니다.구조는 셋입니다. Actor(시도), Evaluator(채점), Self-Reflection(복기)이 에피소드 .. 2025. 10. 19. Plan and Solve Plan-and-Solve 완전 정리, 프롬프트 한 줄로 단계 누락 줄이기요약예시 없이 쓰는 zero-shot 프롬프팅 기법입니다. "Let's think step by step"을 한 단계 발전시켜, 먼저 계획을 세우고 그 계획대로 실행하게 시킵니다.문제의식이 구체적입니다. zero-shot CoT는 계산 오류, 단계 누락, 의미 오해 세 가지로 틀리는데, 그중 단계 누락을 정조준합니다.기법은 둘로 나뉩니다. PS는 계획 후 실행으로 단계 누락을, PS+는 거기에 변수 추출과 중간 계산 기록을 더해 계산 오류까지 겨냥합니다.가장 강한 결과는 이겁니다. 수학 추론에서 예시 8개를 준 8-shot CoT에 필적했습니다. 손으로 예시를 만들지 않고도 few-shot급에 근접했다는 뜻입니다.실무적 매력은 비용.. 2025. 10. 5. ReWOO: Decoupling Reasoning from Observations for Efficient Augmented Language Models ReWOO 완전 정리, 추론을 관찰에서 떼어내면요약ReWOO는 도구를 쓰는 에이전트에서 추론(계획)을 중간 관찰과 분리하는 패턴입니다. 도구 호출을 매번 반응하며 하지 않고 처음에 전체 계획을 한 번에 세웁니다.문제 설정이 날카롭습니다. ReAct처럼 관찰을 끼워 넣으면 관찰이 하나 올 때마다 직전까지의 전체 문맥을 다시 LLM에 밀어 넣어야 해서 토큰이 눈덩이처럼 커집니다.이걸 가능하게 하는 트릭이 증거 자리표시자 #E1, #E2입니다. 아직 모르는 도구 결과를 변수처럼 두고 뒤 단계가 참조하니, 의존 관계가 있는 다단계 작업도 중간 재호출 없이 이어집니다.결과적으로 LLM 호출이 도구 개수와 무관하게 계획 1회와 종합 1회, 총 2회로 고정됩니다.논문 초록 기준으로 HotpotQA에서 토큰 효율 5배.. 2024. 10. 14. ReAct (Reasoning + Acting) ReAct 완전 정리, 추론과 행동을 번갈아 하면 무엇이 달라지나요약ReAct는 Thought와 Action을 번갈아 생성하고, 행동의 결과인 Observation을 다음 추론에 반영하는 에이전트 루프입니다. 이름 자체가 Reasoning + Acting입니다.문제 설정이 명확합니다. 추론만 하면 외부 사실을 못 끌어와 환각에 취약하고, 행동만 하면 무엇을 왜 할지 계획이 없습니다.논문의 표현으로는 "추론 흔적은 행동 계획을 세우고 추적하고 갱신하며 예외를 다루게 돕고, 행동은 외부 소스와 접속해 추가 정보를 모으게 한다"입니다. 양방향입니다.가장 중요한 사실. ReAct는 모델이 아니라 패턴입니다. 새 모델을 학습시키는 게 아니라 같은 LLM에게 형식을 반복하도록 시키는 프롬프팅이자 제어 방식입니다.결.. 2024. 2. 5. 이전 1 다음