이미지 텍스트 추출 프로그램 gImageReader 다운로드 설치 한글 인식 설정 방법
이미지에서 글자를 뽑아내는 무료 프로그램을 찾으면 gImageReader가 자주 나옵니다. 그런데 내려받기 화면에서 맨 위 파일을 받으면 정식판이 아니고, 설치해도 한글이 바로 인식되지 않습니다. 아래에서 어떤 프로그램인지, 어떤 설치 파일을 골라야 하는지, 한국어 데이터를 어떻게 넣는지, 인식률이 안 나올 때 무엇을 건드려야 하는지, 검색되는 PDF를 만드는 방법까지 순서대로 짚었습니다.
체크 포인트
릴리스 맨 위의 CI Build 는 정식판이 아닙니다 — 정식 최신판은 v3.4.3(2025-08-04) · 설치만으로는 한글이 안 됩니다 — 인식 버튼 드롭다운의 Manage languages에서 Korean 설치 · macOS 설치본 없음 · 설치 권한 없으면 portable.zip · tesseract 별도 설치 불필요
이미지 텍스트 추출 프로그램 gImageReader는 어떤 프로그램인가
먼저 구조를 갈라 두면 나중에 덜 헤맵니다. 인식하는 것은 tesseract 이고 gImageReader 는 그것을 다루는 화면입니다. 인식 품질에 관한 이야기는 대부분 tesseract 쪽, 편하게 쓰는 기능은 gImageReader 쪽입니다.
| 구분 | 내용 |
|---|---|
| 정체 | tesseract-ocr 의 Gtk·Qt 프런트엔드 |
| 라이선스 | GPL-3.0+ — 무료이고 업무용 사용에도 비용이 없습니다 |
| 최신 정식판 | v3.4.3 (2025년 8월 4일 공개) |
| 직전 정식판 | v3.4.2 (2024년 2월 5일) |
| 가져오기 | 이미지, PDF, 스캐너, 클립보드, 화면 캡처 |
| 내보내기 | 평문, hOCR, PDF, ODT |
| 운영체제 | 윈도우, 리눅스 — macOS 설치본은 없습니다 |
맥을 쓰신다면 여기서 정리하고 다른 방법을 찾는 편이 빠릅니다. 공식 릴리스에 올라오는 것은 소스 압축본과 윈도우 설치 파일뿐이고 dmg 나 pkg 는 없습니다.
리눅스는 반대로 편합니다. 페도라와 데비안은 공식 저장소에, 우분투는 ppa:sandromani/gimagereader 로, 아치리눅스는 extra 저장소에 gimagereader-gtk 와 gimagereader-qt 로 올라와 있습니다. 배포판을 가리지 않고 쓰려면 Flathub 판도 있습니다.
이미지 텍스트 추출 설치 파일, 맨 위 파일을 받으면 안 되는 이유
이 항목이 이 글에서 가장 값어치 있는 부분입니다. 내려받기 화면 맨 위에 있는 것이 최신 정식판이 아닙니다.
릴리스 목록 제일 위에는 CI Build 라는 항목이 걸려 있습니다. 이것은 소스가 바뀔 때마다 자동으로 만들어지는 개발 중 빌드이고, 정식 릴리스가 아니라 프리릴리스로 표시됩니다. 실제로 이 항목 안에는 3.4.2 파일과 3.4.3 파일이 함께 들어 있습니다. 날짜만 보고 맨 위를 받으면 무엇을 설치했는지도 모르게 됩니다.
정식으로 받아야 할 것은 v3.4.3 태그입니다. 2025년 8월 4일에 공개됐고, 여기 올라온 파일은 소스 압축본 하나와 윈도우용 네 개입니다.
| 구분 | 내용 |
|---|---|
| qt6_x86_64.exe | 대부분 이것입니다. 64비트 설치판 |
| qt6_i686.exe | 32비트 설치판. 스캐너 드라이버가 32비트일 때 필요합니다 |
| qt6_x86_64_portable.zip | 설치 없이 풀어서 실행하는 64비트 무설치판 |
| qt6_i686_portable.zip | 32비트 무설치판 |
| tar.xz | 소스 코드입니다. 일반 사용자에게는 필요 없습니다 |
| gtk 판 | 정식 v3.4.3 자산에는 윈도우용 gtk 판이 없습니다 |
설치 파일을 고를 때 확인할 것이 두 가지입니다.
- 스캐너를 쓸 계획인지 — 쓴다면 드라이버 비트수를 먼저 확인합니다. 아래에서 다시 설명합니다.
- 설치 권한이 있는지 — 회사 PC처럼 설치가 막힌 환경이라면 portable 이 붙은 압축본을 받아 원하는 폴더에 풀고 실행 파일을 바로 실행하면 됩니다.
tesseract 를 따로 설치해야 하는지 묻는 분이 많은데, 필요 없습니다. 공식 FAQ가 윈도우 설치본에 tesseract 파일이 함께 들어 있다고 명시하고 있습니다. 다른 용도로 tesseract 를 따로 설치해 두었더라도 gImageReader 동작에는 영향이 없습니다.
이미지 텍스트 추출 한국어 데이터 설치와 실패할 때
설치를 마치고 이미지를 넣었는데 한글이 엉뚱하게 나온다면 대부분 여기입니다. 처음에는 한국어 인식 데이터가 들어 있지 않습니다.
- 도구모음에서 인식 버튼 오른쪽 화살표를 누릅니다.
- 메뉴에서 Manage languages… 를 선택합니다.
- 목록에서 Korean(kor) 을 찾아 설치합니다.
- 세로쓰기 문서를 다룬다면 kor_vert 가 별도 파일이므로 함께 설치합니다.
- 설치 후에도 언어 목록에 안 보이면 프로그램을 다시 켜거나 애플리케이션 메뉴의 Redetect Languages 를 누릅니다.
- 여러 언어가 섞인 문서라면 드롭다운의 Multilingual 하위 메뉴에서 여러 언어를 동시에 지정할 수 있습니다.
자동 설치가 실패하는 경우가 꽤 있습니다. 원인과 해결이 공식 FAQ에 나와 있습니다.
| 구분 | 내용 |
|---|---|
| 증상 | 언어 설치를 눌러도 실패하거나 목록이 비어 있습니다 |
| 원인 | 설치 폴더에 쓰기 권한이 없기 때문입니다 |
| 해결 | 환경설정에서 저장 위치를 user-local 로 변경 |
| 바뀌는 것 | 언어 데이터가 홈 폴더 아래에 저장되어 권한이 필요 없습니다 |
| 수동 설치했는데 안 보임 | 실제 traineddata 파일이 맞는지 확인합니다 |
| 저장 위치 확인 | 환경설정 대화상자에 경로가 그대로 표시됩니다 |
한 가지 더 갈라 두셔야 합니다. 인식용 언어 데이터와 맞춤법 사전은 다른 것입니다. 앞엣것은 tesseract 가 글자를 알아보는 데 쓰고, 뒤엣것은 인식이 끝난 글의 오타를 잡아 주는 데 씁니다. 한국어 인식만 필요하다면 언어 데이터만 설치하면 됩니다.
이미지 텍스트 추출 작업 순서
화면이 영어라 처음에는 어디를 눌러야 할지 막막합니다. 순서만 잡으면 단순합니다.
- 원본 가져오기 — 왼쪽 위 버튼으로 소스 창을 열고 열기 버튼을 누릅니다. 옆 화살표를 누르면 화면 캡처나 클립보드에 복사된 이미지를 바로 가져올 수 있습니다.
- 이미지 다듬기 — Ctrl 을 누른 채 스크롤하면 확대·축소가 되고, 도구모음에서 임의 각도 회전과 밝기·대비 조절을 할 수 있습니다.
- 인식 모드 선택 — 글자만 필요하면 plain text, 레이아웃까지 살려 PDF로 만들려면 hOCR, PDF 를 고릅니다.
- 언어 선택 — 인식 버튼 드롭다운에서 Korean 을 고릅니다.
- 영역 지정 — 마우스로 끌어 사각형을 그립니다. Ctrl 을 누른 채 끌면 영역을 여러 개 만들 수 있고, 자동 레이아웃 감지 버튼을 누르면 프로그램이 알아서 영역을 잡고 기울기까지 보정합니다.
- 인식 — 인식 버튼을 누르면 오른쪽 출력창에 글자가 나옵니다. 영역을 우클릭하면 출력창 대신 클립보드로 바로 보낼 수도 있습니다.
- 정리 — 출력창 도구모음에서 줄바꿈 제거, 공백 정리, 찾아 바꾸기를 할 수 있고 되돌리기도 됩니다.
- 저장 — 출력창의 저장 버튼으로 파일로 내보냅니다.
문서가 여러 장이라면 소스 목록에서 여러 개를 선택한 뒤 인식 버튼을 누르면 Batch mode 항목이 나타납니다. 이 모드는 선택한 문서를 모두 처리해 결과 파일을 원본 파일 옆에 써 줍니다. 수십 장을 한 장씩 여는 것보다 훨씬 빠릅니다.
이미지 텍스트 추출 인식률이 안 나올 때 건드릴 곳
결과가 기대에 못 미칠 때 손댈 곳은 세 군데로 정리됩니다.
첫째, 해상도 칸입니다. 이 숫자의 의미가 원본 종류에 따라 달라지는데 이걸 모르면 아무리 만져도 소용이 없습니다.
| 구분 | 내용 |
|---|---|
| PDF가 원본일 때 | 렌더링 DPI입니다. 기본값 300 |
| 이미지가 원본일 때 | 배율 퍼센트입니다. 기본값 100(원본 크기) |
| 50으로 하면 | 절반 크기로 줄여서 인식합니다 |
| 작은 글자 | 배율을 올려 키운 뒤 인식시키면 결과가 달라집니다 |
| 왜 이렇게 동작하나 | 이미지에 기록된 dpi 가 대개 화면 dpi(72·96)라 믿을 수 없기 때문입니다 |
| 적용 범위 | 여러 원본을 선택해 두면 한꺼번에 반영됩니다 |
둘째, 언어 데이터의 종류입니다. 프로그램에 내장된 언어 관리자는 속도 우선인 tessdata_fast 저장소에서 파일을 받아옵니다. 정확도 우선으로 만들어진 tessdata_best 는 관리자 목록에 아예 나오지 않습니다. 한국어 파일을 비교하면 차이가 뚜렷합니다.
- 속도 우선(tessdata_fast) 한국어 — 약 1.6메가바이트
- 정확도 우선(tessdata_best) 한국어 — 약 12메가바이트
- 세로쓰기 한국어도 각각 약 1.1메가바이트와 약 3.9메가바이트로 갈립니다
- 정확도 우선 파일은 저장소에서 직접 받아 언어 데이터 폴더에 넣습니다
- 넣은 뒤 Redetect Languages 를 누르면 목록에 나타납니다
- 대신 인식 속도는 느려집니다
셋째, 글자가 깨져 나오는 경우입니다. Qt 인터페이스는 출력 텍스트의 인코딩을 시스템 인코딩과 UTF-8 중에서 고를 수 있는데 기본값이 시스템 인코딩입니다. 한글이 물음표나 깨진 기호로 나온다면 프로그램 설정에서 UTF-8로 바꿔 보세요.
스캐너가 안 잡히는 문제도 여기서 함께 정리합니다. 윈도우에서 gImageReader 는 TWAIN 으로 스캐너와 통신하는데, 공식 FAQ가 드는 원인은 두 가지입니다. 하나는 TWAIN 드라이버 자체가 없는 경우로 제조사 홈페이지에서 TWAIN 드라이버를 받아야 합니다. 다른 하나가 자주 걸리는 쪽인데 드라이버와 프로그램의 비트수가 어긋난 경우입니다. 드라이버가 32비트 폴더에 설치돼 있다면 64비트 윈도우를 쓰더라도 32비트(i686) 판 gImageReader 를 써야 스캐너가 잡힙니다. 반대로 드라이버가 64비트라면 x86_64 판이어야 합니다.
인식이 유난히 느리다면 리눅스에서 OpenMP 가 켜진 tesseract 를 쓰고 있을 가능성이 있습니다. 공식 권고는 OpenMP 를 끄는 것이고, 임시로는 실행 전에 OMP_THREAD_LIMIT 를 1로 지정하면 됩니다.
이미지 텍스트 추출 결과를 검색되는 PDF로 만들기
스캔한 문서를 검색과 복사가 되는 PDF로 바꾸는 것이 이 프로그램을 쓰는 큰 이유 중 하나입니다. 평문 모드로는 안 되고 모드를 먼저 바꿔야 합니다.
- 도구모음의 OCR 모드를 hOCR, PDF 로 바꿉니다.
- 원본을 선택하고 인식 버튼을 누릅니다.
- 출력창에 페이지·문단·줄·단어·그림으로 나뉜 트리가 나타납니다.
- 트리에서 단어를 두 번 누르면 글자를 직접 고칠 수 있습니다. 틀린 단어는 빨간색으로 표시됩니다.
- 출력창 도구모음의 PDF 내보내기 메뉴에서 형식을 고릅니다.
내보내기 형식이 두 가지인데 쓰임이 전혀 다릅니다.
| 구분 | 내용 |
|---|---|
| 원본과 같은 레이아웃·그림으로 재구성한 PDF | |
| 투명 텍스트 PDF | 원본 이미지를 그대로 두고 그 위에 보이지 않는 글자를 얹습니다 |
| 투명 쪽의 장점 | 보기에는 원본과 똑같으면서 검색·선택이 됩니다 |
| 언제 쓰나 | 계약서·증빙처럼 원본 모양을 바꾸면 안 되는 문서 |
| 내보낼 때 묻는 것 | 글꼴, 인식된 글자 크기 사용 여부, 줄 간격 균일화 여부 |
| 용량 조절 | PDF에 들어갈 이미지의 색상 방식·해상도·압축을 고를 수 있습니다 |
여기서 한 가지 걸리는 점이 있습니다. hOCR 모드는 항상 페이지 전체를 인식합니다. 평문 모드처럼 필요한 부분만 사각형으로 지정해 인식시킬 수 없습니다. 일부만 필요하다면 평문 모드로 영역을 지정해 뽑거나, 인식한 뒤 트리에서 필요 없는 항목을 지우는 방식으로 처리하셔야 합니다.
PDF 말고도 hOCR 문서는 평문과 ODT 로 내보낼 수 있습니다. 여러 파일을 한꺼번에 변환하려면 도구모음의 hOCR 일괄 내보내기 기능을 쓰면 폴더 아래의 hOCR 파일을 모두 찾아 같은 자리에 PDF·ODT·텍스트로 써 줍니다.
프로그램이 자꾸 멈추거나 꺼진다면 문의하기 전에 로그부터 챙기세요. 윈도우는 gImageReader 설치 폴더 안의 gimagereader.log 와 twain.log 가 해당 파일입니다.
이미지 텍스트 추출 자주 묻는 질문
Q. gImageReader 는 무료인가요? 회사에서 써도 되나요?
무료입니다. 라이선스가 GPL-3.0+ 이라 개인 사용은 물론 업무용으로 써도 사용료가 없습니다. 소스 코드도 공개돼 있습니다.
Q. 내려받기 화면 맨 위 파일을 받으면 되나요?
아닙니다. 맨 위에 걸린 CI Build 는 정식 릴리스가 아니라 소스가 바뀔 때마다 자동으로 만들어지는 개발 중 빌드이고, 그 안에는 서로 다른 버전의 파일이 섞여 있습니다. 정식 최신판인 v3.4.3 태그에서 받으세요.
Q. 맥에서도 쓸 수 있나요?
공식 릴리스에 macOS 설치본이 올라오지 않습니다. 제공되는 것은 소스 압축본과 윈도우용 설치 파일, 무설치 압축본이며 리눅스는 배포판 저장소와 Flathub로 설치할 수 있습니다.
Q. tesseract 를 따로 설치해야 하나요?
윈도우는 필요 없습니다. 공식 FAQ가 윈도우 설치본에 tesseract 파일이 함께 들어 있다고 밝히고 있습니다. 다른 용도로 tesseract 를 따로 설치해 두어도 gImageReader 동작에는 영향이 없습니다.
Q. 한글이 인식되지 않습니다.
한국어 언어 데이터가 설치되지 않은 것입니다. 인식 버튼 오른쪽 화살표를 눌러 Manage languages 를 열고 Korean 을 설치한 뒤, 목록에 안 보이면 프로그램을 다시 켜거나 애플리케이션 메뉴의 Redetect Languages 를 누르세요.
Q. 언어 데이터 설치가 계속 실패합니다.
설치 폴더에 쓰기 권한이 없을 때 생기는 문제입니다. 환경설정에서 언어 데이터 저장 위치를 user-local 로 바꾸면 홈 폴더 아래에 저장되어 권한 없이도 설치됩니다.
Q. 스캐너가 잡히지 않습니다.
TWAIN 드라이버가 없거나 드라이버와 프로그램의 비트수가 어긋난 경우입니다. 드라이버가 32비트로 설치돼 있으면 64비트 윈도우에서도 32비트(i686) 판을 써야 하고, 드라이버가 64비트면 x86_64 판을 써야 합니다.
Q. 검색이 되는 PDF로 만들려면 어떻게 하나요?
OCR 모드를 hOCR, PDF 로 바꿔 인식한 뒤 출력창의 PDF 내보내기에서 투명 텍스트 오버레이 방식을 고르면 됩니다. 원본 이미지는 그대로 두고 그 위에 보이지 않는 글자를 얹기 때문에 겉모습은 같으면서 검색과 복사가 됩니다.
gImageReader 는 tesseract-ocr 을 쓰기 편하게 감싼 무료 프로그램이고 GPL-3.0+ 라이선스라 업무용으로 써도 비용이 들지 않습니다. 내려받을 때는 릴리스 목록 맨 위의 CI Build 를 지나치고 정식 최신판인 v3.4.3 을 받으세요. 2025년 8월 4일에 공개됐고 윈도우용 설치 파일과 무설치 압축본이 각각 64비트와 32비트로 올라와 있습니다. macOS 설치본은 제공되지 않으니 맥 사용자는 다른 방법을 찾으셔야 합니다. 설치 권한이 없는 PC라면 portable 압축본을 풀어서 그대로 쓰면 되고, tesseract 는 윈도우 설치본에 함께 들어 있어 따로 설치할 필요가 없습니다. 설치 후에는 한국어 데이터를 Manage languages 에서 내려받아야 한글이 인식되고, 설치가 실패한다면 저장 위치를 user-local 로 바꾸면 해결됩니다. 인식률이 아쉬울 때는 해상도 칸부터 보세요. PDF 원본은 DPI, 이미지 원본은 배율 퍼센트로 동작하고 기본값이 각각 300과 100입니다. 더 정확한 인식이 필요하면 정확도 우선 언어 데이터를 직접 받아 넣는 방법이 있습니다. 스캐너가 안 잡히면 드라이버 비트수를 확인하시고, 검색되는 PDF가 필요하면 hOCR, PDF 모드에서 투명 텍스트 오버레이로 내보내면 됩니다.