AI 에이전트가 믿고 쓰는 도구가 거짓말을 하면 어떻게 알아채나. 한 개발자의 '거짓말 MCP 서버' 실험과 인디 빌더가 봐야 할 신호 3 가지
AI 에이전트가 믿고 쓰는 도구가 거짓말을 하면 어떻게 알아채나. 한 개발자의 '거짓말 MCP 서버' 실험과 인디 빌더가 봐야 할 신호 3 가지 📅 2026.08.18 | ✍️ 경제 흐름을 읽어주는 형 오늘 아침 형이 챙긴 소식은 요란한 인수합병이나 조 단위 밸류 얘기가 아니야. 한 개발자가 개발자 커뮤니티 dev.to에 올린 실험 글인데, 형이 매일 하는 고민을 정확히 찌르는 내용이라 골랐어. 요즘 AI 에이전트는 MCP 서버라는 외부 도구를 붙여서 일을 시켜. 그 도구가 자기 설명서에 "나는 이렇게 동작한다"고 써두면 에이전트는 그 말을 그냥 믿고 써. 그런데 이 개발자가 던진 질문이 날카로워. 그 설명서가 거짓말이면 어쩔 건데? 형이 이걸 고른 이유가 있어. 형이 만드는 것들이 죄다 "AI가 하는 말을 그냥 믿지 말고 밖에서 검증하자"는 생각 위에 서 있거든. 이 개발자는 말로만 떠들지 않고, 아예 거짓말하는 도구를 손수 만들어서 그걸 잡아내는 방법까지 보여줬어. 형이 읽은 신호 셋을 풀어볼게. 【 핵심 체크포인트 】 1. 설명서는 뭐든 말할 수 있지만, 진실은 실제로 오는 응답에 있어. 이 글의 한 문장이 핵심을 다 담고 있어. "서버의 설명서는 무슨 말이든 쓸 수 있다. 그게 진짜인지는 도구 목록을 물었을 때 돌아오는 응답이 증명하거나 뒤집는다." MCP 서버는 자기가 상태를 안 남긴다거나, 목록을 캐시해도 된다거나, 도구 순서가 항상 일정하다고 문서에 적어둘 수 있어. 문제는 그 약속을 강제하는 장치가 프로토콜 안에 없다는 거야. 에이전트 입장에선 도구가 하는 말을 확인할 방법이 딱히 없으니 그냥 믿고 넘어가. 이 개발자는 바로 그 빈틈을 파고들었어. 문서가 아니라 실제로 전선을 타고 오는 응답만 보면 된다는 거지. 2. 진짜 검증은 일부러 고장 낸 버전을 만들어 내 검사기가 그걸 잡는지 확인하는 거야. 여기가 형이 무릎을 친 대목이야. 이...