프로젝트 설명
인터넷이 완전 차단된 폐쇄망 환경에서 H200×8 GPU 서버 1노드, H100×1 서버 5노드, CPU 서버 16노드 등 총 22대 이기종 서버 기반 AI 모델(LLM, Embedding, Reranking, OCR) Serving 및 전체 서비스 CI/CD 운영 인프라 구축
- 일반 서버 및 H200 NVLink 워크스테이션을 포함한 전체 인프라의 OS 패키지(CUDA, Drivers 등) 설치 환경 구성을 위해 Local RPM Repository 구축
- Node.JS, Java, Python의 CI/CD 구축
- vLLM Inference 지표(GPU 사용률, Queuing Latency)와 Java/Python GC Processing 지표를 Prometheus로 수집, nGrinder 기반 사용자 시나리오 부하 테스트 수행 (1500 Vuser 안정성 검증)
- RAGAS 프레임워크 + 한국어 데이터셋으로 답변 정확도, 질문 의도 부합도 등을 정량 측정