Post

Openclaw + Ollama 사용기 - 1

Openclaw + Ollama 사용기 - 1

1주일 사용 요약

로컬로 돌리는 개인 비서

최근 알고리즘에 끊임없이 올라오는 moltbot의 등장과 함께 개인 AI 비서가 세상을 휩쓸었다. 유튜브에서 모두가 openclaw가 된 Agent를 찬양하는 이야기가 가득해졌지만 문득 의문이 들었다. 그렇게나 대단한 AI인데 왜 정작 결과물에 대한 이야기는 들리지 않는 걸까. 맥미니만 있으면 누구나 local에서 Ollama를 통해 무제한으로 AI를 사용할 수 있다고 하는데, 왜 그럼 모두가 Ollama를 사용하지는 않는 걸까.

결국 해보지 않으면 알 수 없다. 그래서 맥미니를 구입했다.

스팩

  • 맥미니 M4
  • 32g RAM
  • 512GB 저장공간

주문 후 배송까지 거의 3주가 걸렸다.

실행 방식

보안

Docker로 실행했을 때 파일 조작과 브라우저 작업 등이 잘 되지 않았다. 공식 홈페이지에서 말하는 직접 설치가 본래 목적에 맞게 사용할 수 있는 방법이지만, 컴퓨터에 직접 설치해서 쓰는 건 당연히 위험하다. LLM을 완전히 통제할 수 없으면 의미가 없으니까.

민감 정보는 환경변수로 관리해야 한다.

모델

처음 목적은 100% 로컬로 돌리는 것이었다. Apple Silicon 칩을 최대한 활용하기 위해 LM Studio를 사용했다. 여러 모델의 양자화 버전을 huggingface에서 바로 받을 수 있고 RAM 사용량도 관리할 수 있다.

하지만 32기가 램 중 남은 것은 거의 17~20기가 램이라 절반의 모델은 실행하지 못했다. 결국 Ollama 모델 중 가장 쓸만한 건 glm-4.7-flash였다.

glm-4.7-flash

간단한 HTML 생성 테스트에서는 생각 이상으로 깔끔한 결과를 내뱉었다. 하지만 복잡한 요청에서는 중간에 뻗어버렸다. 일상 대화도 3분 이상 걸렸다.

google/gemma-3-4b로도 시도했지만 가장 빠를 때 1분 정도 걸렸고 Tool 호출은 GLM보다 못했다.

결국 무료는 이유가 있다

무제한 로컬 LLM을 통한 개인 비서는 그저 이론상의 존재였다. 정말로 무제한 로컬 LLM을 사용하려면 RAM이 128GB를 넘어야 매끄럽게 돌릴 수 있다. 차라리 돈을 주고 토큰을 지불하는 편이 나을 것이다.

그러던 중 Open Router에서 (free)라고 적혀있는 LLM들을 일정 토큰 안에서 사용할 수 있다는 사실을 알았다. 가장 Openclaw에서 많이 사용되는 NVIDIA Nemotron 3 Super (free)StepFun: Step 3.5 Flash (free) 두 가지를 골랐다.

StepFun: Step 3.5 Flash (free)

툴 호출 성능도 확실하고 일상 대화도 굉장히 빠르게 답변이 온다. Manager 모델이 필요한 기능에 대해 하위 model을 호출해서 별개로 돌리는 것이 가능한 것을 확인했다.

정리

성능이 좋은 Manager 모델을 하나 두고, 반복작업과 특수 작업 (이미지 분석) 등은 로컬로 돌려서 토큰 사용을 줄이는 것이다. 결국 제대로 Agent를 사용하기 위해서는 로컬에서 모두 해결할 수 없기 때문에 유료 모델과의 타협이 필요하다.

This post is licensed under CC BY 4.0 by the author.