AI가 계약법 질문에서 법학교수를 눌렀어. 스탠퍼드 연구와 인디 빌더가 봐야 할 신호 3 가지
AI가 계약법 질문에서 법학교수를 눌렀어. 스탠퍼드 연구와 인디 빌더가 봐야 할 신호 3 가지
📅 2026.07.12 | ✍️ 경제 흐름을 읽어주는 형
어제 스탠퍼드 로스쿨에서 나온 연구 한 편이 화제였어. AI가 계약법 질문에 답하는 실력으로 법학교수를 이겼다는 내용이야. 형이 이걸 그냥 넘기지 못한 건, 예전에 법률 자동화 시스템을 처음 만들어봤던 기억 때문이야. 그때만 해도 전문 영역은 사람 전문가가 지켜야 한다는 통념이 단단했거든. 그 벽이 어디까지 왔는지 숫자로 보여준 연구라 오늘 소재로 골랐어.
겉으로 보면 AI가 또 시험을 잘 봤다는 흔한 소식 같아. 그런데 방법을 뜯어보면 혼자 제품을 만드는 인디 빌더가 챙겨야 할 신호가 세 갈래로 갈려. 하나씩 풀어보자.
【 핵심 체크포인트 】
1. 단순 암기가 아니라 판단이 필요한 영역에서 이겼어.
이 연구가 무거운 이유는 계약법이라는 소재에 있어. 법조문을 외워서 뱉는 문제가 아니라, 애매한 상황을 읽고 판단을 얹어야 하는 영역이거든. 예일과 뉴욕대, 시카고, 스탠퍼드 같은 학교의 교수 16명이 대표적인 계약법 질문 40개를 직접 만들고 자기 답까지 써냈어. 그다음 답이 누구 것인지 모르는 상태로 서로 채점하게 했어. 비교는 거의 3,000번 이뤄졌고, AI 답이 교수 답과 맞붙어 75%를 이겼어. 형이 여기서 읽는 신호는 분명해. 이제 AI는 정답이 딱 떨어지는 문제만 잘 푸는 게 아니라, 판단과 뉘앙스가 필요한 전문 영역에서도 사람 전문가 상위권과 겨룬다는 거야. 혼자 전문 서비스를 짜는 사람한테는 무서운 소식이 아니라 오히려 든든한 뒷배지. 열 번 붙어 일곱 번 넘게 이겼다는 건 운이 아니라 실력으로 굳어졌다는 뜻이거든. 예전 같으면 변호사나 전문 강사를 붙여야 낼 수 있던 답을, 이제 잘 설계한 도구 하나가 대신 내준다는 얘기야.
2. 품질만 이긴 게 아니라 안전성까지 앞섰어.
형이 제일 눈여겨본 대목은 여기야. 교수들은 답을 평가하면서 학생에게 잘못된 방향을 심어줄 위험이 있는지도 표시했는데, AI 답이 해롭다고 찍힌 비율은 3.5%에 그쳤어. 사람 동료 교수 답이 해롭다고 찍힌 12%보다 훨씬 낮았지. 흔히 AI는 그럴듯하게 틀린 말을 지어낸다고 걱정하잖아. 그런데 잘 감싼 시스템 안에서는 오히려 사람보다 위험한 답을 덜 냈다는 거야. 물론 이건 답 자체의 질을 잰 거지, 실제 교실에 어떻게 들이느냐는 다른 문제라고 연구진도 분명히 선을 그었어. 성급하게 다 갈아치우자는 얘기가 아니라, 무작정 못 믿겠다는 태도도 근거가 없다는 게 연구진의 결론이었지. 품질과 안전을 동시에 앞섰다는 건, 전문 서비스에 AI를 끼우는 걸 무작정 겁낼 이유가 사라졌다는 뜻이야. 겁내는 대신 어떻게 잘 감싸서 쓸지를 고민할 때가 됐다는 신호지.
3. 승부를 가른 건 모델 자체가 아니라 감싸는 방식이었어.
가장 실전적인 대목이 여기야. 연구가 시험한 건 날것의 모델이 아니라 상용 튜터 시스템과 구글의 노트북LM 같은 도구였어. 같은 모델이라도 어떻게 질문을 넣고 어떤 맥락을 붙여주느냐에 따라 답의 질이 갈린다는 뜻이지. 실제로 실험에서는 AI 답의 길이와 구성까지 사람 답과 비슷하게 맞춰놓고 겨뤘어. 조건을 공정하게 깔았는데도 이겼다는 게 핵심이야. 형이 여기서 챙기는 신호는 이거야. 남들과 똑같은 모델을 써도, 그 모델을 어떻게 감싸고 어떤 맥락을 물려주느냐가 결과를 가른다는 거지. 결국 승부처는 모델이 아니라 그 위에 얹는 설계라는 뜻이야. 돈을 더 써서 비싼 모델을 붙이는 경쟁이 아니라, 같은 재료로 더 잘 감싸는 사람이 이기는 판이 됐다는 거지. 자본보다 설계 감각이 앞서는 싸움이라 혼자 만드는 사람한테 유리해.
【 형 빌드 cross-reference 】
이 연구는 형이 붙잡고 있는 것들이랑 정면으로 맞물려.
첫째는 사전 앱이야. 한영 사전을 웹앱으로 검토하고 있는데, 이번 연구가 딱 이런 결의 제품에 힘을 실어줘. 사람이 묻고 AI가 전문가급으로 답해주는 도구가 실제로 사람 전문가를 넘어설 수 있다는 걸 숫자로 보여줬으니까. 단어 뜻을 던져주는 데서 멈추지 않고, 뉘앙스와 쓰임까지 판단해서 풀어주는 쪽으로 설계하면 값어치가 확 올라가. 이번 연구가 그 방향이 헛물이 아니라는 근거가 돼줘.
둘째는 claude-code-masterpack이야. 컨텍스트 엔지니어링을 7개 축으로 정리한 팩인데, 연구의 결론이랑 정확히 겹쳐. 승부를 가른 게 모델이 아니라 감싸는 방식이었다고 했잖아. 같은 모델에 어떤 맥락을 물려주고 질문을 어떻게 짜느냐가 곧 결과를 가른다는 얘기니까. 마스터팩이 가르치는 게 바로 그 맥락 설계라서, 이번 연구가 그 기술의 값어치를 실증해준 셈이야.
셋째는 MINDCHANGE 하네스야. 결과를 내보내기 전에 스스로 다시 검증하는 루프인데, AI 답이 사람보다 해로운 답을 덜 냈다는 대목이랑 결이 같아. 그럴듯하게 틀린 답을 막으려면, 내보내기 전에 한 번 더 의심하고 걸러내는 관문이 필요하거든. 전문 영역에 AI를 끼울수록 이런 검증 루프가 신뢰를 떠받치는 기둥이 돼. 잘 감싼 시스템이 사람보다 안전했다는 이번 결과가 그 필요를 증명해줘.
【 결론 】
어제 연구를 한 문장으로 줄이면 이래. AI는 이제 암기 문제를 넘어 판단이 필요한 전문 영역에서도 사람 전문가 상위권을 이겼고, 승부를 가른 건 모델이 아니라 그 모델을 감싸고 맥락을 물려준 설계였다는 거야. 혼자 전문 서비스를 짜는 인디 빌더한테 이건 오늘 점검할 목록을 던져줘. 내 제품이 단순 검색이 아니라 판단까지 풀어주는지, 남과 같은 모델을 써도 나만의 맥락 설계로 답의 질을 끌어올리고 있는지, 내보내기 전에 위험한 답을 걸러내는 관문이 서 있는지. 전문가만 하던 판단을 AI가 대신 해주는 시대에는, 모델을 가진 쪽이 아니라 그 모델을 잘 감싼 쪽이 이겨.
출처 = AI Outperforms Law Professors in Stanford Law Study (Stanford Law, 2026.07)
이 글은 2026년 7월 12일 뉴스와 데이터를 기반으로 AI 도구를 활용해 재작성했어.
댓글
댓글 쓰기