xberg - 다국어 문서 인텔리전스 프레임워크

1 hour ago 1
  • PDF/이미지/스프레드시트/오디오/URL/아카이브/소스트리 등 무엇을 넣어도 깔끔한 텍스트/표/메타데이터/구조화 데이터를 반환
  • 포맷 감지 부터 OCR,추출을 하나의 코어가 처리해서 여러개의 라이브러리를 이용한 파이프라인 구성할 필요 없음
  • 101개 포맷 / 371개 코드 언어 / 15개 언어 바인딩 / 6개 출력 포맷 지원, 한글 .hwp/.hwpx도 텍스트 추출 가능
  • URL/웹 수집: http(s) URL을 넣으면 단일 문서 추출 또는 링크를 따라 크롤링(Auto/Document/Crawl 모드, crawlberg 엔진 사용)
  • 오디오/비디오 전사: MP3, M4A, WAV, WebM, MP4 트랙을 Whisper ONNX(tiny→large-v3)로 음성→텍스트 변환
  • 아카이브 재귀 추출: .zip, .tar, .gz, .7z 내부 중첩 문서까지 추출
  • OCR 백엔드: Tesseract, PaddleOCR, Candle, VLM(GPT-4/Claude/Gemini Vision 등) 선택 가능, 폴백 체인/신뢰도 점수/언어 자동 감지
  • 레이아웃/표 인식: ML 레이아웃 모델(PP-DocLayout-V3, RT-DETR)과 표 구조 모델(TATR, SLANet)로 읽기 순서와 셀 그리드 복원 → 깔끔한 Markdown
  • 코드 인텔리전스: tree-sitter로 371개 언어에서 함수/클래스/임포트/심볼/독스트링 추출, RAG용 구문 인식 청킹 지원
  • 임베딩/검색: 로컬(ONNX) 또는 165개 프로바이더 호스팅 임베딩, 희소/후기 상호작용(late-interaction), 크로스 인코더 리랭킹
  • 보강(Enrichment): NER, 키워드 추출(YAKE/RAKE), 요약, 번역, PII 마스킹(redaction), 페이지 분류, QR 감지, 언어 감지, 토큰 절감(TOON, JSON 대비 30~50% 절감)
  • 구조화 추출: 로컬(Ollama, LM Studio, vLLM) 또는 호스팅 LLM으로 문서에서 스키마 기반 JSON을 프롬프트 엔지니어링 없이 바로 생성
  • 라이브러리, CLI(12개 명령), REST API(xberg serve), MCP 서버, Docker, Helm으로 배포 가능
  • MIT 라이선스
Read Entire Article