로컬 LLM을 돌리고 싶지만 노트북 팬을 풀가동하고 싶지 않다면—전용 Mac 서버가 가장 편한 해법입니다. 상시 가동 macOS 머신이 Ollama 추론을 맡고, Windows 노트북은 「리모컨」 역할만 합니다. 이 글은 그대로 따라 할 수 있는 30분 타임라인을 제공하며, 초보자도 오늘 밤 첫 curl로 로컬 모델에 연결할 수 있습니다.
대상 독자: 터미널 명령 복사·붙여넣기 가능, 기본 네트워크 개념 보유. Swift 불필요, Mac 소유 불필요. 기준일: 2026-07-27.
결론부터: 30분 후 보여야 할 것
| 마일스톤 | 완료 기준 | 대략 소요 |
|---|---|---|
| 로그인 가능한 Mac 확보 | ssh user@host 성공 |
0–5분 |
| 기본 환경 준비 | brew --version 출력 있음 |
5–12분 |
| 추론 서비스 실행 | ollama list에 모델 표시 |
12–20분 |
| AI 도구 호출 가능 | curl로 로컬 API가 JSON 반환 |
20–26분 |
| 검수 통과 | 헬스체크 스크립트 전부 통과 | 26–30분 |
두 가지 경로: Mac mini 구매 vs 클라우드 Mac
| 항목 | 자체 Mac mini M4 | 클라우드 Mac(Macstripe 등) |
|---|---|---|
| 0단계 | 개봉·전원·macOS 초기 설정 | 콘솔 주문 → SSH 계정 수령 |
| 적합 대상 | 장기 7×24 모델 운영 확정 | 초보 시험, 단기 프로젝트, 로컬 Mac 없음 |
| 메모리 권장 | 24GB 이상(AI 개발 서버) | 24GB 플랜 선택 |
| 30분 내 완료 | 가능(OS 사전 설치) | 더 쉬움(하드웨어 단계 생략) |
판단 요령: 아직 구매 여부 불확실 → 먼저 클라우드 Mac 1주 임대. 가동률 >60%이고 6개월 이상 쓸 예정 → 구매 검토. 구성 비교는 M4 메모리 실측 참고.
착수 전: 준비물
- ☐ 인터넷 가능한 PC(Windows / Linux / 다른 Mac 모두 가능)
- ☐ SSH 클라이언트(Windows 10+ OpenSSH 내장; macOS/Linux는 터미널)
- ☐ 안정적 네트워크(첫 모델 pull 약 4–5GB; 유선 또는 5GHz Wi‑Fi 권장)
- ☐ 관리자 권한(Homebrew 설치, 시스템 설정 변경 가능)
- 전용 AI 개발 Mac 서버
- 일상 업무를 맡지 않는 macOS 노드로 Ollama / Agent / 경량 CI 전담. 메인 노트북과 분리해 swap으로 전체가 느려지는 것을 방지.
- VM 슬라이스가 아님
- Apple Silicon에서 로컬 LLM은 Metal과 통합 메모리가 완전히 필요. 물리 전용 Mac(자체 또는 클라우드 베어메탈)을 선택하고, 「공유 vCPU Mac 클라우드 데스크톱」을 서버로 쓰지 말 것.
0–5분: 「SSH 가능한 Mac」 확보
경로 A: 클라우드 Mac(초보 추천)
- Macstripe 콘솔에서 M4 24GB 노드와 가까운 리전 선택.
- 개통 후 기록: IP, SSH 포트, 사용자명, 초기 비밀번호(또는 키).
- 로컬에서 연결 테스트:
ssh -p 22 your_user@your_server_ip
# 첫 연결 시 yes로 지문 신뢰
경로 B: 자체 Mac mini
- macOS 설정 도우미 완료, 로컬 사용자 생성.
- 시스템 설정 → 일반 → 공유 → 원격 로그인: 켜기.
- 동일 LAN에서
ssh your_user@mac-mini.local, 또는 라우터 포트 포워딩(운영 환경은 Tailscale / WireGuard 권장—본문 생략).
AllowUsers 제한을 사용하세요.5–12분: 시스템 초기화와 Homebrew
로그인 후 순서대로 실행(블록 전체 복사 가능):
# 1. Apple Silicon과 메모리 확인
uname -m # arm64 출력되어야 함
sysctl hw.memsize | awk '{print $2/1024/1024/1024 " GB"}'
# 2. Xcode 명령줄 도구(대화상자에서 설치, 약 2–5분)
xcode-select --install 2>/dev/null || true
# 3. Homebrew 설치
/bin/bash -c "$(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/HEAD/install.sh)"
echo 'eval "$(/opt/homebrew/bin/brew shellenv)"' >> ~/.zprofile
eval "$(/opt/homebrew/bin/brew shellenv)"
# 4. 기본 도구
brew install git jq htop
키보드: macOS 터미널 붙여넣기 ⌘+V; 원격 Windows 터미널은 Ctrl+Shift+V가 흔함.
brew 권한 오류 시 관리자 사용자 로그인 여부, 기업 MDM으로 설치 소스가 잠겼는지 확인.
12–20분: Ollama와 첫 모델
# Ollama 설치(공식 스크립트)
curl -fsSL https://ollama.com/install.sh | sh
# 로그인 시 자동 시작(선택; 서버 권장)
brew services start ollama
# 코딩용 7B 모델 pull(약 4.5GB; 네트워크에 따라 3–10분)
ollama pull qwen2.5-coder:7b
# 빠른 시험
ollama run qwen2.5-coder:7b "전용 Mac 서버가 무엇인지 한 문장으로 설명해줘"
| 모델 | 메모리 사용(대략) | 적합 용도 |
|---|---|---|
qwen2.5-coder:7b |
5–6 GB | 일상 보완, 단일 파일 리팩터 |
deepseek-coder:6.7b |
5 GB | 대체 coder 모델 |
qwen2.5-coder:14b |
10–12 GB | 24GB+ 머신만—메모리 실측 참고 |
프레임워크 선택은 고민 불필요: 초보는 Ollama 기본. 자세히는 Ollama vs MLX 기본 규칙.
20–26분: AI 코딩 툴체인 연결
흔한 연결 방식 세 가지—하나만 골라 이 절을 완료.
방식 1: 로컬 Cursor + 원격 Ollama API
노트북에 Cursor 설치, OpenAI 호환 엔드포인트를 Mac 서버로 지정:
# Mac 서버에서 API 도달 확인(기본 11434)
curl http://127.0.0.1:11434/api/tags
LAN에서 임시 개방(개발 환경만):
# 예시만: 운영은 방화벽 / 리버스 프록시 + TLS
launchctl setenv OLLAMA_HOST "0.0.0.0:11434"
brew services restart ollama
노트북 브라우저에서 http://서버IP:11434 접속 시 API 응답(또는 404여도 포트 개방) 확인.
방식 2: SSH에서 Claude Code
# Mac 서버에서
npm install -g @anthropic-ai/claude-code # 또는 공식 문서 따름
claude # 안내에 따라 로그인; 모델은 클라우드 API 가능
로컬 모델 보조 시 Ollama를 OpenAI 호환 백엔드로 설정(방식 1과 동일 엔드포인트).
방식 3: VS Code Remote-SSH
- 노트북에 VS Code + Remote-SSH 확장 설치.
Cmd/Ctrl+Shift+P→ Remote-SSH: Connect to Host →your_user@your_server_ip입력.- 원격 창에서 Python 등 언어 확장 설치, 코드는 서버에서 실행.
세 도구 동일 머신 실측은 M4 AI 코딩 실측 참고.
26–30분: 검수와 헬스체크
아래를 ~/ai-mac-healthcheck.sh로 저장 후 chmod +x:
#!/bin/bash
set -e
echo "== AI Mac Server Health Check =="
echo -n "[1/5] Architecture: "; uname -m
echo -n "[2/5] Free memory (GB): "; vm_stat | awk '/Pages free/ {print $3*4096/1024/1024/1024}'
echo -n "[3/5] Ollama: "; command -v ollama && ollama --version
echo -n "[4/5] Models: "; ollama list | tail -n +2 | wc -l | xargs echo "count"
echo -n "[5/5] API probe: "
curl -sf http://127.0.0.1:11434/api/tags >/dev/null && echo "OK" || echo "FAIL"
echo "Done."
검수 기준(펼쳐서 대조)
- 5항목에
FAIL없음 - `ollama run`이 10초 내 출력 시작
- 노트북 SSH가 10분간 끊기지 않음
- 디스크 여유 > 30GB(모델·로그 지속 증가)
흔한 실패와 빠른 수정
| 현상 | 가능 원인 | 조치 |
|---|---|---|
ollama 극도로 느림 / 타임아웃 |
메모리 부족 swap | 7B로 변경; Chrome 종료; 24GB 업그레이드 |
SSH Connection refused |
원격 로그인 꺼짐 / 방화벽 | 공유 설정·보안 그룹 확인 |
brew 설치 멈춤 |
GitHub 연결 불안정 | 리전 변경 또는 프록시 설정 |
| 외부에서 API 불가 | 127.0.0.1만 리슨 | OLLAMA_HOST 설정 및 방화벽 허용 목록 |
첫 pull 중단 |
네트워크 변동 | ollama pull 재실행(이어받기 지원) |
옛 상식: 「AI 개발 서버는 GPU 서버가 필수.」
Apple Silicon에서는 통합 메모리 + Metal이 로컬 추론의 핵심;Linux GPU 클라우드를 무작정 임대하면 Cursor / Xcode 생태계와 맞지 않음.
결론: 다음 단계
30분 후 갖춰야 할 것:
- SSH 가능한 macOS 노드(클라우드 Mac 또는 Mac mini)
- 가동 중인 Ollama + coder 모델 최소 1개
- 노트북에서 연결된 AI 코딩 경로(Cursor API / Claude Code / Remote-SSH 중 택1)
D+1 권장: 실제 저장소로 Agent 작업 1회, 메모리 피크·tok/s 기록. 16GB에서 swap이 잦으면 메모리 구성 실측에서 티어 선택—느린 머신에 억지로 버티지 말 것.
타임라인 요약
| 분 | 작업 |
|---|---|
| 0–5 | Mac 확보 + SSH 로그인 |
| 5–12 | CLI 도구 + Homebrew |
| 12–20 | Ollama + qwen2.5-coder:7b |
| 20–26 | Cursor / Claude Code / VS Code 연결 |
| 26–30 | ai-mac-healthcheck.sh 검수 |
아직 머신이 없다면? 먼저 클라우드 Mac으로 위 흐름을 통과한 뒤, 랙에 둘 두 번째 Mac mini 구매 여부를 결정하세요—「먼저 사고 메모리 부족을 깨닫는」 것보다 훨씬 낫습니다.
자주 묻는 질문
완전 초보도 30분이면 되나요?
「원격 로그인 + Ollama 추론 + API 1회」 최소 루프는 가능합니다. Xcode 설치·첫 모델 다운로드는 +15–30분 여유. 클라우드 Mac 개통은 보통 5분 이내가 가장 빠릅니다.
Mac mini를 사야 AI 개발 서버를 만들 수 있나요?
아닙니다. 핵심은 안정적 macOS, 충분한 RAM, SSH 상시 노드입니다. 클라우드 Mac을 일 단위로 빌려 워크플로를 검증한 뒤 구매를 결정하세요.
16GB로 AI 개발 서버로 충분한가요?
7B coder + 경량 Agent는 가능. Chrome 다수 탭 + Xcode + 14B 동시는 부담. 일상 AI 코딩 서버는 24GB+, 14B 상시·다중 사용자는 32GB+.
Ollama vs MLX?
초보는 Ollama 기본. MLX는 벤치·파인튜닝용이며 첫 서버 가이드 필수는 아닙니다.
Windows 노트북에서 어떻게 코딩하나요?
SSH에서 Claude Code; GUI는 VNC 또는 VS Code Remote-SSH. Cursor는 로컬 설치 후 Ollama API를 Mac 11434 포트로 지정.