DeepSeek v4 flash 성능을 향상 시킨 방법을 소개합니다. 속도가 2배 이상 빠르게하는 bash 명령도 있고, 추론 엔진에서 사용하는 옵션도 있습니다. 확인해 보세요.
bash 명령 하나로 DeepSeek v4 Flash: 11 → 25 tok/s 향상
저자는 이전 벤치마크 성능을 게시한 글에서 모델 예상치보다 낮다는 피드백을 받았습니다. 이에 u/pseudonerv 피드백에 따라서 재연을 하는 과정에서 llama.cpp build 버전이 다른 것을 확인하고는 Custom AppleClang build 993 (071327508) 버전으로 Apple M5 Max · 128 GB unified memory, 동일 모델, 동일 프롬프트에서 이전 보다 빠른 25 TPS 성능을 얻을 수 있었다고 합니다.
Unsloth, DeepSeek V4 Flash-0731, DSpark 사용으로 2배 더 빠르게
지난 주 공개한 DeepSeek v4 flash (0731) 버전에 대한 칭찬이 많습니다. Unsloth는 여기에 더 해서 DSpark 사용으로 기존 모델 보다 1.4~2x 빠른 성능을 얻을 수 있도록 만든 모델을 선 보였습니다. 댓글에 보면 DGX Spark 128GB에서 기존 10 tps => 20 tps 성능 향상이 있었다는 보고가 함께 있네요. Local 에서 실행하기에는 상당한 VRAM/RAM 을 필요로 해서 직접 시험하기 어렵지만 하드웨어 사양이 되시면 시험해 보시기 바랍니다.
OpenCode Go 가격 추적기
OpenCode Go는 $10/월 정액제 구독 서비스를 제공합니다만 모델별 정확하게 호출당 가격을 밝히고 있지는 않습니다. 1M 토큰 기준, 한 달 $60로 환산했을 때의 모델별 가격을 정리한 사이트입니다. 모델 선택에 참고하시기 바랍니다.
※ 지난 게시글:
- AI 뉴스 훑어보기 – 2026.8.6
- AI 뉴스 훑어보기 – 2026.8.5
- MoE 시각화 – OLMoE 모델의 토큰 흐름 시각화
- AI 뉴스 훑어보기 – 2026.7.16
- AI 뉴스 훑어보기 – 2026.7.15
※ 출처: r/LocalLLM, r/openclaw, r/unsloth, r/opencode, r/claude











