라벨이 LM Studio인 게시물 표시

로컬 LLM 으로 에이전틱 코딩이 진짜로 돌아간다. M2 맥 + Gemma 4 + LM Studio 흐름과 인디 빌더가 봐야 할 신호 3 가지

로컬 LLM 으로 에이전틱 코딩이 진짜로 돌아간다. M2 맥 + Gemma 4 + LM Studio 흐름과 인디 빌더가 봐야 할 신호 3 가지 📅 2026.06.17 | ✍️ AI 흐름을 읽어주는 형 형이 이번에 봐도 흐름이 진짜로 갈아탔어. 6개월 전에는 로컬 LLM 으로 에이전트를 돌리면 너무 느리거나 정확도가 떨어져서 결국 클라우드 API 결제로 돌아갔는데. 어제 Hacker News 1위에 올라온 Vicki Boykis 글이 보여주는 건 그 벽이 무너졌다는 신호야. 2022년형 M2 맥북에 Gemma 4 12B 모델을 올리고 LM Studio 로 돌리면 프런티어 모델의 75% 정도 정확도와 속도가 나온다는 거지. ⚡ 핵심 체크포인트 3 1. 하드웨어 진입선이 64GB 램 으로 내려왔어. Boykis 가 쓴 머신은 2022년형 M2 맥북에 램 64GB 1TB 저장공간. 새로 출시된 H100 GPU 가 아니라 4년 된 일반 노트북이야. 테스트한 모델 후보는 Mistral 7B 부터 Gemma 3 와 OpenAI OSS-20B 그리고 Qwen 3 MoE 까지 다 돌아갔고 최종 추천은 gemma-4-12b-qat. 12B 사이즈에 양자화까지 들어간 모델이면 32GB 램 머신도 진입 가능해. 인디 빌더가 GPU 클러스터를 임대하지 않고 자기 책상 위 노트북에서 에이전트를 돌리는 그림이 처음으로 현실이 됐어. 2. 추론 도구가 완전히 평민화됐어. 핵심 도구는 LM Studio. 클릭 몇 번 으로 모델 파일을 다운받고 OpenAI 호환 API 서버가 자동으로 열려. 코드 안 OPENAI_BASE_URL 환경변수만 localhost 로 바꾸면 기존 OpenAI 클라이언트 라이브러리가 그대로 동작하는 구조야. llama.cpp 도 Ollama 도 llamafile 도 같은 방향으로 정렬됐고. 이게 갖는 의미는 한 가지야. 토큰 비용이 0 으로 갈 수 있다는 거. Copilot 이 토큰 결제로 갈아탄 5월말 사건에서 어떤 개발자는 월 2...