본문 바로가기 메뉴 바로가기

개발과 일상

프로필사진
  • 글쓰기
  • 관리
  • 태그
  • 방명록
  • RSS

개발과 일상

검색하기 폼
  • 분류 전체보기 (312)
    • 개발 (248)
      • AI (36)
      • AWS&인프라 (64)
      • 데이터베이스&캐시 (16)
      • Kotlin&JAVA (26)
      • SPRING (41)
      • 뭔지모르면여기 (47)
      • 코딩테스트 (16)
    • 일상 (61)
      • 책&강의후기 (15)
      • 대외활동 (22)
      • 생각정리 (9)
      • 여행 (12)
      • 경제? (3)
  • 방명록

Quantization (1)
LLM 모델 양자화해보기 Q4와 Q8 사이?

지난 글에서는 학습한 모델을 GGUF로 바꿔 Ollama에 올렸다. 그때 "GGUF Q8_0으로 변환했다"고 한 줄 적고 넘어갔는데, 사실 그 한 줄에는 숨은 결정이 하나 있었다. 어느 정밀도로 양자화할 것인가. 이번 글은 RAG 구축 고려사항 중 ⑦모델 양자화에 해당하는, 그 결정에 대한 이야기다.1. 양자화는 결국 "비트를 줄이는 일"이다모델은 수십억 개의 가중치, 그러니까 숫자 덩어리다. 이 숫자를 원본은 보통 16-bit 부동소수점(fp16)으로 저장한다. 양자화는 이 숫자를 더 적은 비트로 근사해서 저장하는 일이다. 8-bit, 4-bit로 누르는 식이다. 왜 이게 크기에 직접 영향을 주냐면, 모델 용량은 거의 "가중치 개수 × 가중치 하나당 바이트"로 정해지기 때문이다. 정밀도를 낮추면 가중치..

개발/AI 2026. 6. 20. 17:15
이전 1 다음
이전 다음
공지사항
최근에 올라온 글
최근에 달린 댓글
Total
Today
Yesterday
링크
TAG
  • java
  • 람다
  • 스프링부트
  • lambda
  • Spring
  • terraform
  • 온디바이스 AI
  • 후쿠오카
  • GIT
  • rag
  • springboot
  • AWS EC2
  • Kotlin
  • 티스토리챌린지
  • ChatGPT
  • AWS
  • CORS
  • OpenAI
  • docker
  • Redis
  • CloudFront
  • 오블완
  • 인프런
  • Log
  • cache
  • S3
  • EKS
  • serverless
  • elasticsearch
  • 질의처리
more
«   2026/07   »
일 월 화 수 목 금 토
1 2 3 4
5 6 7 8 9 10 11
12 13 14 15 16 17 18
19 20 21 22 23 24 25
26 27 28 29 30 31
글 보관함

Blog is powered by Tistory / Designed by Tistory

티스토리툴바