Command Code의 DeepSeek 가격 정책에 오해할 만한 표현이 있다합니다. AI 모델이 필요로하는 VRAM 크기는 KV Cache와 같이 메모리를 필요로 하는 다른 요소도 고려해야 합니다. Ryzen AI Max+ 395 성능 시험도 읽어 보십시오.
Ollama Cloud 새로운 가격 정책 관련 반응
지난 8/31, Ollama가 새로운 ollama cloud 가격 정책을 발표했습니다. ollama cloud 주간/월간 사용량이 공개되어 있지 않은 것에 사용자들 불만이 높았습니다. 이번 발표 제목이 “Ollama’s transparent pricing” 로 할 정도로 자신들의 서비스 가격과 사용량을 공개했습니다. 문제는 사용자들의 판단을 조금 다르다는데 있습니다. 레딧의 ‘Ollama의 “투명한” 유료 플랜은 사기입니다. 절대 바꾸지 마세요.’ 글에서는 ollama가 “투명성”을 내세워 정액 요금제에서 API 토큰 과금(재판매자들이 쓰는 방식)으로 전환하려 하는데, 이는 실질적으로 요금을 대폭 올리는 사기(현금 수취)라는 주장하고 있습니다. 요금에 따른 사용량을 시물레이션한 결과도 제시하고 있는데 다수의 의견은 현재의 정액 요금을 유지하고 새로운 토큰 과금으로 변경하지 말라고 합니다. 새로운 Pro 가격은 이전보다 제공하는 리소스가 상당히 줄어든 것으로 보입니다. 글에서는 벤치마크 스크립트와 로그를 통해 모델별 토큰 비용과 쿼터 소모를 추정했고, 추정 결과는 모델에 따라 이전 대비 약 3–6배 적은 리소스를 의미한다고 보고하고 있습니다. 다수의 의견도 요금 인상에 동의하고 있습니다.
Ollama는 무료 사용자에 대한 사용량 제한도 기존 대비 더 적어졌음을 명시하고 있으니 참고하십시오.
일반 소비자용 GPU 에서의 대용량 모델 사용 방법
아래 2개의 글은 VRAM이 각각 8GB, 16GB 인 GPU 에서 최신의 대용량 모델을 실행한 후기를 소개하고 있습니다. Cold Expert 를 VRAM이 아닌 SSD에 저장하거나 VRAM 사용 효율을 극대화하기 위한 옵션이나 양자화 기술 등을 적극 활용해 보고 있습니다. 실제 사용 여부와는 무관할 수 있지만 다양한 시도를 통해서 일반 소비자 GPU 에서 사용 가능하다는 것을 확인할 수 있습니다.
- 16GB GPU에서 Qwen3.8-Flash-Next-Uncensored (125B MoE) 실행 중! AMD RX 9070 XT 및 llama.cpp ROCm에서 컨텍스트의 50% (132K 토큰)를 처리.
모델 파일을 프로세스 주소공간에 mmap만 해두고, 운영체제의 페이지 캐시가 필요한 전문가(expert) 블록을 SSD → RAM으로 채워서 매우 느린 디스크 I/O 병목을 회피.
- 8GB VRAM 스쿼드, Qwen 3.6 35B A3B GGUF에서 30t/s 이상 기록 경신에 도전
- –mlock 옵션으로 llama-server가 약 19.5GB 물리 RAM을 고정 사용, MoE 레이어와 KV 캐시 오프로드 유지.
- GPU VRAM은 어텐션 레이어와 CUDA 버퍼에 약 7.2GB 사용.
- TurboQuant 압축으로 메모리 사용량 최소화.
※ 지난 게시글:
- AI 뉴스 훑어보기 – 2026.8.10
- AI 뉴스 훑어보기 – 2026.8.7
- AI 뉴스 훑어보기 – 2026.8.6
- AI 뉴스 훑어보기 – 2026.8.5
- MoE 시각화 – OLMoE 모델의 토큰 흐름 시각화
※ 출처: r/LocalLLM, r/openclaw, r/unsloth, r/opencode, r/claude













