라벨이 콘텐츠 모더레이션인 게시물 표시

미스트랄이 손바닥만 한 안전 검사기를 공짜로 풀었어. 3B 오픈웨이트 모더레이션 모델 Shieldstral과 인디 빌더가 봐야 할 신호 3 가지

미스트랄이 손바닥만 한 안전 검사기를 공짜로 풀었어. 3B 오픈웨이트 모더레이션 모델 Shieldstral과 인디 빌더가 봐야 할 신호 3 가지 📅 2026.08.05 | ✍️ 경제 흐름을 읽어주는 형 오늘 아침 형이 챙긴 소식은 프랑스 AI 회사 미스트랄이 내놓은 작은 모델 하나야. 이름이 Shieldstral(실드스트랄)인데, 하는 일이 딱 하나야. 어떤 글이나 이미지를 놓고 이게 안전한 내용인지 위험한 내용인지 점수를 매겨 주는 검사기지. 파라미터가 30억 개(3B)밖에 안 돼서 16기가짜리 그래픽카드 한 장이면 굴러가. 무게가 이 정도인데 자기보다 최대 7배 큰 경쟁 모델들과 붙어서 이기거나 비슷하게 나온다고 회사가 밝혔어. 게다가 아파치 2.0 라이선스라 누구나 공짜로 가져다 상업적으로 써도 돼. 형이 이 소식을 고른 이유가 있어. 겉보기엔 대기업들 안전팀 이야기 같지만, 실은 우리 같은 인디 빌더한테 딱 맞는 물건이거든. 그동안 AI 에이전트나 챗봇을 만들면 늘 걸리는 게 있었어. 사용자가 이상한 걸 입력하거나 모델이 위험한 답을 뱉으면 그걸 누가 걸러 주냐는 문제였지. 지금까지는 큰 회사의 유료 API를 붙이거나 무거운 모델을 따로 돌려야 했어. 그런데 이번엔 손바닥만 한 검사기를 공짜로 내 서버에 심을 수 있게 된 거야. 형이 여기서 읽는 신호 셋을 풀어볼게. 【 핵심 체크포인트 】 1. 안전 규칙을 코드가 아니라 평범한 문장으로 준다. 이게 이번 모델의 진짜 새로운 점이야. 예전 안전 검사기들은 미리 정해 둔 위험 항목 목록을 통째로 학습시켜야 했어. 항목을 바꾸려면 모델을 다시 훈련해야 하니까 손이 많이 갔지. 그런데 Shieldstral은 검사할 때마다 그냥 우리말 같은 평범한 문장으로 기준을 넣어 줘. 예를 들어 이 내용이 폭력을 부추기냐고 묻고, 얼마나 엄격하게 볼지도 문장으로 알려 주면 끝이야. 모델은 그걸 예 아니오 문제로 바꿔서 0에서 1 사이의 점수를 돌려줘. 형이 여기서 읽는 신호는 이래. 서비...