AI 에이전트한테 도구를 그냥 쥐여줬다간 사고 나. 한 개발자가 만든 '문지기'와 인디 빌더가 봐야 할 신호 3 가지
AI 에이전트한테 도구를 그냥 쥐여줬다간 사고 나. 한 개발자가 만든 '문지기'와 인디 빌더가 봐야 할 신호 3 가지
📅 2026.08.14 | ✍️ 경제 흐름을 읽어주는 형
오늘 아침 형이 챙긴 소식은 AI 에이전트를 굴려 본 사람이라면 무릎을 칠 얘기야. 한 개발자가 에이전트한테 도구를 맡길 때마다 겁이 나서, 아예 도구 앞에 문지기를 하나 세웠어. Agent ToolTrust라는 물건인데, 에이전트가 어떤 도구를 부르려고 하면 그 호출을 실행 직전에 가로채서 지금 이거 해도 되는 상황인지를 먼저 따져 봐.
형이 이 소식을 고른 이유가 있어. 형이 굴리는 자동화가 대부분 에이전트한테 진짜 도구를 쥐여 주는 구조거든. 텔레그램으로 글을 내보내고 파일을 만지고 외부에 뭔가를 쏘는 일까지 알아서 하게 두는 거야. 그 편함 뒤에 늘 걸리는 게 얘가 엉뚱한 걸 실행하면 어쩌지 하는 불안이었어. 이 개발자가 그 불안을 정면으로 붙잡았더라고. 형이 읽은 신호 셋을 풀어볼게.
【 핵심 체크포인트 】
1. 도구를 통짜로 허용하는 방식이 지금 가장 큰 구멍이야.
요즘 에이전트 시스템은 도구를 줄지 말지를 단순하게 허용 아니면 거부로만 정해. 문제는 같은 동작이라도 상황에 따라 위험도가 완전히 달라진다는 거야. 테스트 서버에서 뭔가를 지우는 건 아무 일도 아니지만, 실제 운영 서버에서 같은 걸 지우면 사고야. 그런데 지금 대부분의 도구 권한은 이 맥락을 아예 안 봐. 이 개발자가 인용한 수치가 뼈아파. 조직의 80퍼센트가 자기네 에이전트가 원래 정한 범위를 넘어서는 행동을 한 적이 있다고 인정했고, MCP 서버 배포 가운데 접근 범위를 제대로 좁혀 둔 곳은 18퍼센트뿐이야. 보안 표준을 만드는 OWASP도 에이전트의 도구 오남용을 1급 위험으로 올려놨어. 편하자고 열어 둔 문이 그대로 사고의 통로가 되고 있다는 뜻이야.
2. 진짜 해법은 검증을 모델 밖에 두는 거야.
이 문지기가 똑똑한 지점이 여기야. 에이전트가 도구를 부르면, 실행하기 전에 지금 환경이 어디인지, 다루는 데이터가 얼마나 민감한지, 어떤 종류의 행동인지를 따져서 네 갈래로 갈라. 그냥 허용, 기록만 남기고 허용, 사람한테 확인받게 올리기, 아니면 거부. 핵심은 이 판단이 AI 모델 바깥에 있다는 거야. LLM은 이런 정책이 있는지조차 몰라. 그러니까 사용자가 프롬프트로 아무리 꼬드겨도 거부를 뚫을 수가 없어. 판단하는 놈과 실행을 막는 놈이 서로 다른 층에 있으니까. 게다가 모르는 도구가 들어오면 일단 막고 보는 방식이라, 빈틈이 생겨도 안전한 쪽으로 닫혀. 형이 오래 붙잡아 온 생각하고 정확히 같아. AI 자체를 믿는 게 아니라, AI 밖에 검증하는 껍데기를 한 겹 두르는 거야.
3. 말로만 안전하다가 아니라 실제로 돌려서 증명했어.
형이 이 글에서 제일 좋아한 대목이야. 이 개발자는 가짜 에이전트로 대충 시늉만 낸 게 아니라, LangGraph, CrewAI, OpenAI, 구글 ADK 같은 10개 프레임워크 위에서 83개의 진짜 에이전트를 돌려서 검증했어. 그렇게 2,490개의 테스트를 만들었고, 값비싼 AI 호출은 영리한 설계로 206번까지 줄이면서도 커버 범위는 그대로 지켰지. 실제로 위험한 도구 호출을 막았더니 에이전트가 알아서 안전한 다른 방법으로 계획을 다시 짜더라는 결과까지 확인했어. 여기서 형이 건지는 교훈은 분명해. 안전장치는 만들었다는 말로 끝나면 안 되고, 진짜 환경에서 돌려서 막히는 걸 눈으로 봐야 믿을 수 있다는 거야.
【 형 빌드에 어떻게 이어지나 】
형이 만들고 있는 것들에 이 문지기 이야기가 어떻게 걸리는지 짚어볼게.
MINDCHANGE 하네스 부터야. 형이 짓는 이 자가검증 루프는 AI가 내놓은 결과를 곧이곧대로 믿지 않고, 밖에서 한 번 더 따져 보고 어긋나면 되돌리는 장치야. 이번 문지기가 판단을 모델 바깥에 둬서 프롬프트로 못 뚫게 만든 발상하고 뿌리가 같아. AI를 못 믿어서가 아니라, 믿을 수 있으려면 밖에 검증하는 껍데기가 있어야 한다는 생각이지. 이 소식은 형이 그 방향으로 가고 있는 게 맞다는 걸 다시 확인시켜 줬어.
agent-starter-kit 하고도 곧장 이어져. 형이 만든 이 텔레그램 에이전트 키트는 사람이 옆에 안 붙어도 알아서 도구를 부르고 뭔가를 실행하는 물건이야. 편한 만큼 위험도 같이 커. 이 문지기처럼 도구 호출 앞에 실행 전 검문소를 하나 세우고, 운영이냐 테스트냐에 따라 허용 수위를 다르게 두는 설계를 키트 안에 기본으로 넣어 두면, 남들이 사고 치고 뒷수습할 때 형 키트는 처음부터 안전한 쪽으로 닫혀 있게 돼.
num_ctx 하네스 하고도 결이 맞아. 형이 만든 이 검증 도구는 AI한테 넘긴 내용이 중간에 잘려서 엉뚱한 답이 나오는 걸 밖에서 잡아내는 물건이야. 문지기가 도구 호출을 밖에서 검문하듯, num_ctx는 모델이 삼킨 입력을 밖에서 검문해. 둘 다 AI 안에서 벌어지는 일을 밖에서 지켜본다는 같은 철학 위에 서 있어. 형이 하네스라는 이름으로 묶어 온 게 결국 이 감시하는 껍데기들이었던 거야.
【 결론 】
정리하면 이래. 한 개발자가 에이전트한테 도구를 통짜로 맡기는 게 겁나서, 도구 호출을 실행 직전에 가로채 맥락을 따지고 허용부터 거부까지 네 갈래로 나누는 문지기를 만들었어. 핵심은 그 판단을 AI 모델 바깥에 둬서 프롬프트로는 못 뚫게 했다는 거야. 형이 하네스라는 이름으로 오래 붙잡아 온 생각하고 똑같아. AI를 못 믿는 게 아니라, 믿으려면 밖에서 지켜보는 껍데기가 한 겹 있어야 한다는 거지. 형이 인디 빌더한테 남기고 싶은 한마디는, 에이전트가 알아서 잘하겠지에 기대지 말고 실행 앞에 검문소를 하나 세우라는 거야. 오늘 당장 할 수 있는 건 간단해. 내 에이전트가 부를 수 있는 도구를 쭉 적어 보고, 그중에 잘못 눌리면 진짜 사고 나는 게 뭔지부터 골라내는 거야. 그 하나에만 실행 전 확인을 걸어 둬도, 편함에 딸려 오던 불안이 절반은 줄어.
출처: dev.to, I Stopped Trusting AI Agents With Tools. So I Built a Gatekeeper.
이 글은 2026.08.14 뉴스 + 데이터 기반 AI 도구 활용 재작성.
댓글
댓글 쓰기