GitHub TrendingAI · 머신러닝

google/langextract

Google, LLM 기반 비정형 텍스트 추출 라이브러리 공개

원제 google/langextract

스타 38,842당일 +154Python
Key Point

LLM 기반 데이터 추출의 신뢰성과 추적성을 해결하는 새로운 도구로, 의료·법률·금융 등 정확도가 중요한 도메인에서 비정형 문서 처리 방식을 바꿀 가능성이 있다.

핵심 요약

  • Google이 LangExtract라는 Python 라이브러리를 공개했으며, LLM을 이용해 비정형 텍스트에서 구조화된 정보를 추출한다.
  • 추출한 정보가 원문의 정확한 위치에 매핑되어 시각화 및 검증이 가능하고, Gemini 같은 모델의 제어 생성을 통해 스키마 무결성을 보장한다.
  • 텍스트 청킹, 병렬 처리, 다중 패스 전략으로 장문서 처리를 최적화했으며, 대화형 HTML 뷰어로 수천 개 추출 항목을 맥락 내에서 시각화한다.
  • Gemini 클라우드 모델 외에도 OpenAI, Ollama 로컬 LLM, Vertex AI 등 다양한 LLM 플랫폼을 지원한다.
  • 사용자 정의 프롬프트와 소수 샷 예제로 도메인 특화 추출 작업을 정의하며, 모델 미세조정 없이 적응 가능하다.
  • Gemini 3.5 Flash가 권장 기본 모델이며, 대규모 워크로드는 Gemini 3.1 Flash-Lite, 복잡한 작업은 Gemini Pro 모델을 고려할 수 있다.
  • 병렬 처리와 향상된 민감도로 전체 장편소설 같은 대용량 문서에서 수백 개 항목을 높은 정확도로 추출할 수 있으며, 대규모 작업을 위해 Vertex AI Batch API로 비용을 절감할 수 있다.
  • 라이브 데모에서 Shakespeare의 로미오와 줄리엣, 의료 기록 추출, 방사선학 보고서 구조화 등 다양한 사용 사례를 제공한다.
  • 경량 플러그인 시스템으로 커스텀 LLM 프로바이더를 독립적으로 추가할 수 있으며, 핵심 라이브러리 변경 없이 제3자 제공자를 배포하고 통합할 수 있다.
  • API 키는 AI Studio (Gemini), Vertex AI (엔터프라이즈), OpenAI Platform 등에서 획득하며, 환경 변수, .env 파일, 서비스 계정 등으로 설정할 수 있다.
  • 비정형 텍스트와 근거 정보의 균형을 프롬프트 지시와 예제로 제어할 수 있으나, 추출 정확도는 선택 모델, 작업 복잡성, 프롬프트 명확도에 따라 달라진다.
  • LLM이 예제가 아닌 입력 텍스트에서 추출할 수 없는 내용은 `char_interval = None`으로 표시되어 필터링으로 근거 결과만 유지할 수 있다.
  • Apache 2.0 라이선스이며, 건강 관련 응용은 Google Health AI Developer Foundations Terms of Use의 적용을 받는다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗