AI의 '숨겨진 속마음'은 사실 안 숨겨져 있었어. 암호로 잠근 추론 과정이 통째로 털린 사건과 인디 빌더가 봐야 할 신호 3 가지

AI의 '숨겨진 속마음'은 사실 안 숨겨져 있었어. 암호로 잠근 추론 과정이 통째로 털린 사건과 인디 빌더가 봐야 할 신호 3 가지

AI의 '숨겨진 속마음'은 사실 안 숨겨져 있었어. 암호로 잠근 추론 과정이 통째로 털린 사건과 인디 빌더가 봐야 할 신호 3 가지

📅 2026.08.12 | ✍️ 경제 흐름을 읽어주는 형

오늘 아침 형이 챙긴 소식은 상용 AI를 쓰는 사람이라면 등골이 좀 서늘해질 얘기야. 오픈AI나 앤트로픽, 구글 같은 곳은 자기 모델이 답을 내기 전에 속으로 생각하는 과정, 그러니까 추론 과정을 남한테 안 보여주려고 암호로 잠가서 주고받아. 회사의 기술이 새어 나가는 걸 막으려는 거지. 그런데 한 연구팀이 그 잠금장치가 사실상 헐겁게 뚫려 있다는 걸 실제로 보여줬어.

형이 이 소식을 고른 이유가 있어. 형이 만드는 것들 대부분이 이런 상용 AI API 위에 얹혀서 굴러가는 자율 에이전트거든. 회사가 "이건 암호로 잠가 놨으니 안전해"라고 한 부분을 그대로 믿고 그 위에 뭘 쌓았는데, 그 잠금이 실은 허술했다는 얘기니까 형한테도 남 일이 아니야. 형이 읽은 신호 셋을 풀어볼게.

【 핵심 체크포인트 】

1. 회사가 잠가 둔 '속마음'이 그대로 풀렸어.

튀빙겐의 ELLIS 연구소와 막스플랑크 연구소 사람들이 8월 10일 '상용 LLM API에서 추론 과정 훔치기'라는 제목의 논문을 냈어. 핵심은 이래. 오픈AI, 앤트로픽, 구글은 모델이 속으로 굴린 생각을 암호 덩어리로 바꿔서 돌려주고, 다음 요청 때 그걸 다시 받아. 그런데 이 암호 덩어리가 같은 회사 안에서는 세션이 달라도, 쓰는 사람이 달라도, 심지어 모델이 달라도 서로 갖다 쓸 수 있게 호환되더라는 거야. 연구팀은 이 허점을 파고들었어. 힘센 모델이 만든 암호 추론 덩어리를 같은 회사의 약하고 방어가 덜 된 모델한테 집어넣으면, 그 약한 모델이 암호를 풀어서 원래 생각을 글자 그대로 뱉어 내. 회사가 못 본다고 잠가 둔 속마음이 고스란히 까지는 거지.

2. 네 로그가 이미 새고 있을 수 있어.

진짜 무서운 건 그 다음이야. 연구팀은 사람들이 깃허브 같은 공개 저장소에 무심코 올려 둔 암호 추론 덩어리를 무려 31만 5,320개나 긁어모았어. 그걸 위 방법으로 풀어 봤더니, 개인을 특정할 수 있는 정보가 367건, 그리고 API 키처럼 지금도 살아 있는 비밀 값이 182개나 튀어나왔어. 무슨 뜻이냐면, 에이전트를 돌리다 보면 이 암호 추론 덩어리가 로그나 대화 기록에 자동으로 쌓이는데, 사람들은 어차피 암호니까 괜찮겠지 하고 그걸 그대로 커밋하거나 남한테 넘겨. 근데 그 안에 내 계정 비밀번호랑 고객 정보가 통째로 들어 있고, 그게 풀린다는 거야. 암호처럼 생겼다고 안전한 게 아니었어. 특히 요즘은 에이전트 대화 기록이나 디버깅 로그를 그대로 공개 저장소에 올려 두는 경우가 흔한데, 나는 그냥 알아보기 힘든 문자열이라고 여겼던 게 실은 남이 풀면 내 열쇠가 되는 셈이지.

3. 큰 회사의 블랙박스를 그냥 믿지는 마.

형이 여기서 읽는 세 번째 신호는 태도 문제야. 우리는 보통 큰 회사가 알아서 암호로 잠가 줬으니까 그 부분은 내가 신경 안 써도 된다고 넘어가. 근데 이번 일은 그 믿음이 위험하다는 걸 보여줘. 회사가 안전하다고 말한 블랙박스라도, 그게 내 시스템을 지나가는 순간부터는 내 책임이 돼. 특히 인디 빌더는 옆에 보안팀이 따로 없으니까, 내가 다루는 데이터가 어디에 어떤 모양으로 쌓이는지를 스스로 챙기는 수밖에 없어. 암호로 보인다고 안심하지 말고, 민감한 게 섞여 있다고 전제하고 다뤄야 한다는 거지.

【 형 빌드에 어떻게 이어지나 】

형이 만들고 있는 것들에 이 사건이 어떻게 걸리는지 짚어볼게.

agent-starter-kit 부터야. 형이 만든 이 텔레그램 AI 에이전트 키트는 사람이 옆에 안 붙어도 알아서 일이 돌아가게 엮은 물건이라, 대화와 실행 기록이 계속 로그로 남아. 이번 논문은 그 로그를 그냥 쌓아 두면 안 된다는 걸 정확히 짚어 줬어. 추론 덩어리든 API 키든 개인정보든, 밖으로 내보내거나 커밋하기 전에 자동으로 걸러 내고 지우는 스크러빙 단계를 키트 기본값으로 넣어야 해. 어차피 암호니까 괜찮겠지 하는 가정이 제일 위험한 구멍이었으니까.

claude-code-masterpack 하고도 이어져. 형이 정리하는 이 컨텍스트 엔지니어링 묶음은 AI한테 무슨 맥락을 어떻게 쥐여 주고 어떻게 되받을지를 다루는 물건이야. 회사가 돌려주는 암호 추론 덩어리도 결국 내가 다음 요청에 다시 실어 보내는 맥락의 일부인데, 이번 일은 그걸 그냥 지나가는 부속이 아니라 민감한 데이터로 취급해야 한다는 걸 보여줬어. 어떤 맥락을 오래 들고 있고, 어떤 건 쓰고 바로 버릴지를 설계에 넣어야 값이 커져.

Hermes C2PA 통로 도 살짝 걸려. 형이 만드는 이 인증 통로는 어떤 결과물이 진짜 누구 손에서 나왔는지를 증명하는 물건이야. 추론 덩어리가 같은 회사 안에서 이렇게 서로 복사되고 호환된다면, 어떤 모델이 실제로 무엇을 만들었는지를 뒤에서 증명해 두는 일의 값은 더 커져. 이건 앞의 둘보다는 먼 연결이지만, 출처와 진위를 챙기는 방향이 왜 중요한지를 다시 확인시켜 준 사건이야.

【 결론 】

정리하면 이래. 큰 AI 회사들이 기술 보호를 위해 암호로 잠가 둔 모델의 추론 과정이, 같은 회사의 약한 모델에 집어넣는 방법으로 글자 그대로 풀렸어. 연구팀은 공개 저장소에서 긁은 31만 5,320개의 암호 덩어리에서 개인정보 367건과 살아 있는 비밀 값 182개를 실제로 꺼냈고. 형이 인디 빌더한테 남기고 싶은 한마디는, 암호처럼 보인다고 안전하다고 믿지 말라는 거야. 내 시스템을 지나가는 데이터는 결국 내 책임이고, 로그에 쌓이기 전에 걸러 내는 습관 하나가 나중에 계정과 고객을 지켜 줘. 오늘 당장 할 수 있는 건 간단해. 공개 저장소에 올라간 에이전트 로그부터 한 번 훑어서 비밀 값이 섞여 있는지 확인하고, 앞으로는 커밋 전에 자동으로 걸러 내는 장치를 하나 끼워 두는 거야. 자율을 켜는 만큼 그 뒤를 챙기는 손도 같이 키워야 해.

출처: arXiv 2608.09867, Stealing Reasoning Traces from Proprietary LLM APIs / Hacker News 토론

이 글은 2026.08.12 뉴스 + 데이터 기반 AI 도구 활용 재작성.

댓글

이 블로그의 인기 게시물

AI 메모리 도구가 모델 정확도를 깎고 있다, 사용자 비위 맞추기 현상의 첫 데이터와 인디 빌더가 봐야 할 신호 3 가지

Meta 가 인도에 168 MW AI 데이터센터를 짓는다. Reliance 와 손잡은 글로벌 컴퓨트 분산 흐름과 인디 빌더가 봐야 할 신호 3 가지

엔비디아가 직접 증명했어. 진짜 주인공은 AI 모델이 아니라 그걸 감싼 '하네스'라는 거. 인디 빌더가 봐야 할 신호 3 가지