DataForgeBNi&C

v1.2.1

On-Device AI Data Factory

책상 위 미니 서버가
학습 데이터셋을 만듭니다

사내 규정집·매뉴얼·스캔 문서를 파인튜닝용 한국어 QA 데이터셋으로. 랙도, 클라우드도 필요 없습니다. 손바닥만 한 AI 슈퍼컴퓨터 한 대면 충분합니다.

GB10 계열 장비(ASUS Ascent GX10, NVIDIA DGX Spark)에서 개발·검증

ASUS Ascent GX10 - GB10 기반 초소형 AI 슈퍼컴퓨터, Accelerated by NVIDIA

ASUS Ascent GX10 - GB10 Grace Blackwell 기반 초소형 AI 슈퍼컴퓨터

100%온디바이스 실행 - 외부 API 호출 없음
1PFLOPDGX Spark 한 대의 AI 연산 성능
5모델단계별 전용 오픈웨이트 모델
10점 척도독립 심사 모델의 품질 검증
ASUS Ascent GX10 - 손바닥 크기의 GB10 AI 슈퍼컴퓨터

Enterprise, Miniaturized

서버룸의 일을
책상 위로 가져왔습니다

DataForge의 다섯 모델 파이프라인은 본래 서버 랙급 인프라가 필요한 작업입니다. NVIDIA GB10 Grace Blackwell의 128GB 통합 메모리 덕분에, 이 모든 것이 손바닥 크기 장비 한 대에서 돌아갑니다.

  • 120B 대형 모델까지 단일 장비에서 구동
  • 일반 사무실 전원 콘센트로 운영 - 별도 전산실 불필요
  • 문서가 장비 밖으로 나가지 않는 물리적 보안 경계
  • 도입 시 장비 사양에 맞춘 모델 구성 지원 (32GB급 장비도 가능)

NVIDIA Enterprise

같은 기술 계보,
가장 작은 시작점

BN I&C는 NVIDIA 엔터프라이즈 AI 인프라를 공급합니다. Vera Rubin 세대의 랙스케일 시스템부터 책상 위 ASUS Ascent GX10까지 - DataForge는 이 계보의 가장 작은 장비에서 실행됩니다.

NVIDIA DGX Vera Rubin NVL72 랙스케일 시스템
DGX Vera Rubin NVL72랙스케일 · 데이터센터
NVIDIA DGX Rubin NVL8 서버
DGX Rubin NVL8서버 노드 · 전산실
NVIDIA DGX AI 컴퓨트 시스템
DGX AI Compute System엔터프라이즈 · 온프레미스
ASUS Ascent GX10
ASUS Ascent GX10책상 위 · DataForge 실행 환경

제품 이미지: BN I&C (bninc.co.kr) 제공 · NVIDIA 제품 사진

원칙

보안 문서로 만드는
학습 데이터의 기준

클라우드 API에 문서를 올릴 수 없는 조직을 위해 설계했습니다. 금융·의료·공공·제조 - 데이터가 나가면 안 되는 모든 곳에서.

Private

데이터가 밖으로 나가지 않습니다

OCR부터 품질 검증까지 다섯 단계 전부가 사내 장비에서 실행됩니다. 외부 API 호출이 코드에 존재하지 않으며, 최초 모델 설치 후에는 완전 오프라인으로 운영됩니다.

Ontology

도메인 지식을 아는 추출

무엇을 뽑을지(용어·절차·규정·수치)와 어떤 질문을 만들지(5가지 QA 유형)를 YAML 온톨로지로 선언합니다. 도메인이 바뀌면 파일 하나만 수정합니다.

Verified

만든 모델이 채점하지 않습니다

생성과 다른 계열의 독립 심사 모델이 10점 척도로 채점해 미달을 걸러내고, 임베딩 유사도로 중복을 제거합니다. 남는 것은 검증된 데이터뿐입니다.

파이프라인

다섯 단계, 다섯 모델

각 단계에 그 기능에 맞는 오픈웨이트 모델이 배정되어 있습니다. 고객사 장비 사양에 맞춰 전부 교체할 수 있습니다.

01

수집 · OCR

PDF·DOCX·MD는 물론 스캔 문서와 이미지도 한국어 OCR로 읽습니다.

glm-ocr
02

온톨로지 추출

선언된 개념 유형에 맞는 지식만 구조화해 뽑아냅니다.

qwen3:30b
03

QA 생성

다섯 유형의 질문-답변 쌍을 원문 근거로만 생성합니다.

gpt-oss:120b
04

판정 · 중복 제거

독립 심사 모델의 채점과 임베딩 중복 제거를 거칩니다.

exaone3.5 + bge-m3
05

학습 연결

TRL SFTTrainer에 바로 넣는 JSONL로 출력됩니다.

dataset.jsonl

산출물

실제 데모 실행 결과

DGX Spark에서 샘플 문서 2건(텍스트 1 + 스캔 이미지 1)으로 실행한 결과입니다. 문서 2건이 검증 통과 QA 22쌍이 되었습니다.

절차안내
원격근무를 시작하려면 어떤 절차를 따라야 하나요?
사내 포털에서 신청서를 작성하고, 직속 부서장의 승인을 받은 뒤, 인사팀이 최종 확인 후 시작일을 통보합니다. 전체 절차는 영업일 기준 5일 이내에 완료됩니다.
사실확인
2단계 인증 의무화는 언제부터 시행되나요?
2026년 9월부터 전 직원은 2단계 인증을 의무적으로 사용해야 합니다.

출처 추적 - 모든 QA에 원문 문서와 청크 위치가 기록됩니다. 두 번째 답변은 스캔 이미지에서 OCR로 추출됐습니다.

요구사항

장비에 맞춘 두 가지 구성

표준 구성은 DGX Spark급 통합 메모리 장비에 최적화되어 있고, 경량 구성은 32GB급 장비를 지원합니다.

항목표준 구성 (DGX Spark급)경량 구성
메모리96GB 이상 통합 메모리32GB
QA 생성 모델gpt-oss:120bqwen3:30b-a3b
운영체제Linux / macOS · Python 3.10+ · Ollama
네트워크최초 모델 다운로드 후 완전 오프라인 운영 가능

라이선스

구매 · 평가 문의

장비 수 기반 연간 라이선스로 제공됩니다. 평가용 라이선스로 귀사 문서에 직접 실행해 보고 결정하십시오.

cmlee@bninc.co.kr
  • Ed25519 서명 기반 오프라인 라이선스 - 폐쇄망에서도 인증
  • 구매 전 환경 점검(doctor) 무료 제공
  • 패키지는 다운로드 페이지에서 즉시 받을 수 있습니다 (실행에는 정품 라이선스 필요)
  • 라이선스 기간 내 기술 지원·마이너 업데이트 포함
  • 생성 데이터셋의 권리는 고객사에 귀속