KoreanLLM
‹ 피드로게시글
운영진 자료버전 Gemma 3 4B IT (local vision/OCR discussion)출처 열기

Gemma 3 4B IT, OCR은 프롬프트와 이미지 조건에 따라 체감이 갈린다

운영진 자료 모음 · 2025년 공개 후기. 공개 사용자의 OCR·이미지 경험을 모아, 이미지 종류·프롬프트 길이·로컬 실행 방식이 결과를 바꾸는지 묻는 토론입니다. 운영진이 같은 이미지를 통제된 조건에서 실행한 결과가 아닙니다. [공식 자료에서 확인되는 범위] Google 공식 문서는 Gemma 3 4B를 텍스트·이미지 입력에서 텍스트를 출력하는 모델로 분류합니다. 공식 Gemma Cookbook에는 Gemma 3 4B-IT로 이미지의 문서를 JSON으로 추출하는 예제가 있습니다. 이미지 이해와 문서 추출 사용 사례는 공식 지원 범위에 있지만, 모든 OCR 이미지에서 정확하다는 뜻은 아닙니다. [공개 사용자 경험] - r/LocalLLaMA의 2025-03-18 글 작성자는 Streamlit, Ollama, PIL, pdf2image를 조합해 Gemma 3 vision을 로컬 OCR 앱으로 사용했습니다. - 댓글에는 한 사용자가 Gemma 3 4B 4bit Ollama 환경에서 텍스트 추출 전용 시스템 프롬프트로 잘 작동했다고 보고했고, 다른 사용자는 처음 테스트에서 OCR이 기대보다 약해 Qwen2.5-VL을 선택했다고 말했습니다. - 같은 대화에서 더 복잡한 프롬프트를 넣으면 환각이 늘고 단순한 프롬프트가 낫다는 보고가 있었으며, 12B에서도 단순 추출 지시가 잘 맞았다는 별도 경험이 나왔습니다. 이 기록은 Gemma 3 4B IT가 OCR에 항상 우수하다는 결론도, Qwen2.5-VL이 항상 우수하다는 결론도 뒷받침하지 않습니다. 이미지 해상도·표 구조·언어·프롬프트·출력 형식을 함께 남겨야 비교가 가능합니다. [여러분에게 묻습니다] 1. 영수증·스크린샷·표·PDF 중 어떤 이미지에서 Gemma 3 4B IT가 잘 읽었고, 어느 부분을 놓쳤나요? 2. 텍스트만 추출과 설명을 요구하는 긴 프롬프트에서 누락·환각이 얼마나 달라졌나요? 3. 4B·12B·Qwen2.5-VL을 같은 이미지와 출력 형식으로 비교했다면 모델 파일, 해상도, 온도, 결과 차이를 공유해 주세요. 출처: https://www.reddit.com/r/LocalLLaMA/comments/1je5r7f/example_app_doing_ocr_with_gemma_3_running_locally/ ; https://ai.google.dev/gemma/docs/get_started ; https://ai.google.dev/gemma/docs/core/gemma_library ; https://github.com/google-gemini/gemma-cookbook/blob/main/Gemma/README.md

답글

아직 답글이 없습니다. 사용한 맥락을 함께 이야기해 주세요.

작성 내용은 브라우저에 먼저 보존되며, 실제 계정 확인 후 서버에 제출됩니다.
이 게시글 신고
운영: 네오 제네시스개인정보처리방침문의소개