Search
moon
sun
🤖

개인용 AI 에이전트·하네스 연구 및 운영

기간
2024/07/12 → 2026/08/01
2 more properties

경험 편찬 1차 정리

사실과 맥락

2024년 7월부터 agent의 profile·memory·planning·action, single/multi-agent 구조와 자체 검증·설명 가능성·신뢰성·과도한 반복 문제를 논문과 구현 사례 중심으로 정리함.
공군 Airwards 3.0에서는 rule과 LangGraph node로 허용 경로를 미리 제한하고 graph에 Marp MCP를 연결했으며, 개인 시스템에서는 OpenClaw·Hermes·Codex와 Browser·Notion·MCP·skills를 조합해 실제 작업을 수행함.
높은 자율성은 예상 밖 경로와 잘못된 tool/agent 호출 가능성을 늘리지만, 경로를 과도하게 고정하면 LLM의 비선형성과 long-tail 대응 가능성을 잃는 trade-off를 반복해서 경험함.

판단과 행동

초기에는 rule과 LangGraph 분기로 에이전트의 이동 경로를 통제했으나, 이후에는 관찰→추론·계획→도구 실행→검증의 단순한 single-agentic loop에 필요한 능력을 versioned skills와 MCP로 연결하는 구조를 선호하게 됨.
통제 대상을 모든 실행 경로가 아니라 권한·도구 계약·근거·기록·검증의 경계로 옮기는 관점을 수립함. 단순 loop 자체가 자동으로 안전하거나 디버깅 가능한 것은 아니므로 trace·replay·eval과 고위험 작업 승인 경계가 함께 필요하다고 판단함.
모델 내부의 agent loop와, 외부 완료 조건을 검사해 미완료 시 checkpoint부터 다시 호출하는 Ralph식 verification loop를 구분함. 지속 실행은 prompt 길이보다 완료 조건·진행 상태·재개 지점을 외부화하는 문제로 다룸.
Hermes의 profile별 config·memory·session·skills와 외부 CLI credential/cache의 경계가 다름을 확인하고, agent별 identity와 tool 권한이 섞이지 않도록 profile·환경변수·sandbox 범위를 분리하는 방법을 정리함.

결과와 근거

Airwards 3.0에서 LangGraph graph–Marp MCP 연결 완료 티켓을 남김. ✈️대한민국 공군 AI개발팀 IT개발관리병 복무
TUNiNG 영업 자동화에서 단발 에이전트가 5~6건 뒤 중단되는 문제를 5건 단위 checkpoint와 Ralph식 verification loop로 보완해 수백 개 동아리를 처리함. 튜닝 밴드 공연 운영 플랫폼 개발
OpenClaw의 기본 600초 timeout을 3,600초로 늘린 뒤에도 browser 오류·중간 보고 후 종료가 남는 것을 확인하고, timeout 연장만이 아니라 외부 진행 상태와 재시작 가능한 작업 단위가 필요하다는 근거를 확보함.
Agent Skills의 progressive disclosure와 visibility·update ownership을 분석해, 기능을 skill로 추가할수록 초기 관측 surface와 업데이트 책임도 함께 커진다는 운영 원칙을 정리함.

핵심 학습

개인 비교 경험상 rule·graph로 모든 경로를 조립하는 방식보다 단순한 single-agentic loop와 skills·MCP 조합이 능력 확장과 원인 격리에 유리했음.
알려진 failure를 rule로 빠르게 막는 것과, 새로운 failure가 평가·도구·skill 개선으로 환류되는 구조를 만드는 것은 다른 문제임.
agent의 자율성과 안전성은 반대말이 아니라 서로 다른 위치에 둘 수 있음. 자율성은 loop 안에 두고, 안전성은 권한·근거·검증·승인의 boundary에 두는 설계가 핵심임.

한계와 확인 필요

단순 single-agentic loop가 LangGraph 고정 경로보다 우월하다는 정량 benchmark나 동일 조건 비교 실험은 없음. 현재 표현은 공군·개인 시스템을 모두 운영한 뒤 얻은 사용자 회고와 설계 관점임.
Airwards 3.0의 전체 node·state·tool 구성, 사용 규모, 프로덕션 성과는 아직 확인되지 않음.
TUNiNG의 수백 건 처리와 현재 DB 규모는 운영 근거이나, 모든 레코드가 에이전트로 생성됐거나 실제 메시지 발송·영업 전환으로 이어졌다고 확대하지 않음.
의료 AI·임상 workflow·규제 경험은 없음. 의료 적용 시 trace·replay·eval·human approval은 앞으로 해결하려는 설계 과제로 구분함.

이력서 표현 후보

Agent architecture 실전 비교: 공군 LangGraph 기반 고정 경로 에이전트와 OpenClaw·Hermes 기반 개인 single-agentic loop를 모두 적용하고, skills·MCP로 능력을 분리해 확장성과 원인 격리 용이성을 높인 경험
지속 실행과 안전 경계: 장기 작업의 완료 조건·진행 상태·checkpoint를 외부화하고, agent 내부 loop와 Ralph식 verification loop를 분리해 중단 후 재개 가능한 작업 구조 설계

경험 원천