vLLM
•
가상 대규모 언어 모델 (Virtual Large Language Model)
•
qwen
한국어 추출 모듈
개발 시 알아야 할 것
•
LLM 모델 파라미터 수(사이즈)
•
운영 환경 GPU 사양
•
샘플 pdf
Qwen2-VL-2B는 "생성형(generative)" 모델이라, 글자를 인식하는 게 아니라 다음 토큰을 예측합니다. 그래서 흐릿한 한글을 만나면 언어 모델의 습관대로 그럴듯한 글자를 만들어냅니다(환각). "환각 없이 정확히"가 목표라면, 2B 생성형 VLM은 구조적으로 불리합니다. (OCR 환각 연구)
한글은 특히 주의
이 모델들의 학습 데이터는 영어·중국어가 압도적이고 한글 비중은 작습니다. 그래서:
•
한글에 대한 시각 인식력 자체가 영·중보다 약하고,
•
흐린 한글을 만나면 기댈 "한글 언어 prior"도 부실해서 → 엉뚱한 한글로 메우는 환각이 더 잘 납니다.
•
72B로 키워도 이 데이터 불균형은 그대로입니다.
그럼 무엇이 환각을 실제로 줄이나
연구가 제시하는 효과적인 방법은 크기 키우기가 아니라:
1.
입력 이미지 품질 (해상도·선명도) — 환각의 최대 변수. "흐림"을 없애는 게 가장 직접적.
2.
불확실성 자각 학습 (uncertainty-aware SFT/RL): 모델이 "안 보이면 추측 말고 거부"하게 파인튜닝. 7B 모델이 이걸로 GPT-4o 대비 환각-free 정확도 22%p 개선. (같은 논문)
3.
전용 OCR 엔진과 병행/대조 — 검출+인식 기반이라 애초에 "지어내기"를 안 함.
OCR 모델에 대해 알아보기 (easyOCR vs paddleOCR vs Qwen)


