Apple Silicon

Apple Silicon

MacBook Pro M4 Max + Mac Studio M4 Max => RDMA 클러스터로 로컬 LLM 실행하기

서문 Apple Silicon Mac 두 대를 연결하면 강력한 로컬 LLM 클러스터를 구축할 수 있습니다. MacBook Pro M4 Max 64GB와 Mac Studio M4 Max 64GB를 Thunderbolt 케이블로 연결하고, Apple의 MLX 프레임워크에서 제공하는 JACCL 백엔드(RDMA over Thunderbolt)를 활용하면 두 기기의 GPU 성능을 합쳐 70B급 대형 모델을 로컬에서 실행할 수 있습니다.

By mulpats

AI

Gemma 4 12B IT 완전 분석: 기존 모델과 무엇이 달라졌나, M4 Max에서는 얼마나 빠른가

솔직히 말하면, 구글이 Gemma 3을 출시했을 때만 해도 '그래, 이 정도면 준수하지'라는 반응이 많았다. 그런데 Gemma 4 12B가 나오고 나서 상황이 좀 달라졌다. 특히 12B 모델이 코딩 벤치마크에서 이전 세대 27B 모델을 훌쩍 뛰어넘는 수치를 보여주니, 이걸 그냥 지나치기가 어렵다. 이번 글에서는 Gemma 4 12B IT(Instruction-Tuned)

By mulpats

AI

oMLX — 맥에서 로컬 LLM을 제대로 쓰기 위한 추론 서버

맥에서 LLM을 로컬로 돌려본 사람이라면 한 번쯤 Ollama를 설치했을 거다. 설치는 쉽고, 모델도 잘 받아지고 — 근데 조금 쓰다 보면 뭔가 아쉽다. 동시에 여러 요청을 보내면 버벅이고, 한 번 세션이 끊기면 컨텍스트를 처음부터 다시 읽어야 하고, 모델 여러 개를 관리하려면 터미널을 뒤적여야 한다. 맥이 이 정도 하드웨어인데, 좀 더 잘 쓸

By mulpats