DataForgeBNi&C
v1.2.1
Enterprise, Miniaturized
DataForge의 다섯 모델 파이프라인은 본래 서버 랙급 인프라가 필요한 작업입니다. NVIDIA GB10 Grace Blackwell의 128GB 통합 메모리 덕분에, 이 모든 것이 손바닥 크기 장비 한 대에서 돌아갑니다.
NVIDIA Enterprise
BN I&C는 NVIDIA 엔터프라이즈 AI 인프라를 공급합니다. Vera Rubin 세대의 랙스케일 시스템부터 책상 위 ASUS Ascent GX10까지 - DataForge는 이 계보의 가장 작은 장비에서 실행됩니다.




제품 이미지: BN I&C (bninc.co.kr) 제공 · NVIDIA 제품 사진
원칙
클라우드 API에 문서를 올릴 수 없는 조직을 위해 설계했습니다. 금융·의료·공공·제조 - 데이터가 나가면 안 되는 모든 곳에서.
OCR부터 품질 검증까지 다섯 단계 전부가 사내 장비에서 실행됩니다. 외부 API 호출이 코드에 존재하지 않으며, 최초 모델 설치 후에는 완전 오프라인으로 운영됩니다.
무엇을 뽑을지(용어·절차·규정·수치)와 어떤 질문을 만들지(5가지 QA 유형)를 YAML 온톨로지로 선언합니다. 도메인이 바뀌면 파일 하나만 수정합니다.
생성과 다른 계열의 독립 심사 모델이 10점 척도로 채점해 미달을 걸러내고, 임베딩 유사도로 중복을 제거합니다. 남는 것은 검증된 데이터뿐입니다.
파이프라인
각 단계에 그 기능에 맞는 오픈웨이트 모델이 배정되어 있습니다. 고객사 장비 사양에 맞춰 전부 교체할 수 있습니다.
PDF·DOCX·MD는 물론 스캔 문서와 이미지도 한국어 OCR로 읽습니다.
glm-ocr선언된 개념 유형에 맞는 지식만 구조화해 뽑아냅니다.
qwen3:30b다섯 유형의 질문-답변 쌍을 원문 근거로만 생성합니다.
gpt-oss:120b독립 심사 모델의 채점과 임베딩 중복 제거를 거칩니다.
exaone3.5 + bge-m3TRL SFTTrainer에 바로 넣는 JSONL로 출력됩니다.
dataset.jsonl산출물
DGX Spark에서 샘플 문서 2건(텍스트 1 + 스캔 이미지 1)으로 실행한 결과입니다. 문서 2건이 검증 통과 QA 22쌍이 되었습니다.
출처 추적 - 모든 QA에 원문 문서와 청크 위치가 기록됩니다. 두 번째 답변은 스캔 이미지에서 OCR로 추출됐습니다.
요구사항
표준 구성은 DGX Spark급 통합 메모리 장비에 최적화되어 있고, 경량 구성은 32GB급 장비를 지원합니다.
| 항목 | 표준 구성 (DGX Spark급) | 경량 구성 |
|---|---|---|
| 메모리 | 96GB 이상 통합 메모리 | 32GB |
| QA 생성 모델 | gpt-oss:120b | qwen3:30b-a3b |
| 운영체제 | Linux / macOS · Python 3.10+ · Ollama | |
| 네트워크 | 최초 모델 다운로드 후 완전 오프라인 운영 가능 | |