ukong.dev
~/ukong

ukong ~ %

▸ output

최유빈 · Youbin Choi

AI Engineer & Researcher

환각을 줄이는 검색증강 시스템을 연구하고, 실제로 배포합니다.

retrieve › focus

  • RAG
  • LLM Hallucination
  • Information Retrieval
  • NLP
  • Evidence Verification
about

더 나은 미래를 만들기 위해

더 나은 미래를 만들기 위해 다양한 IT 분야를 시도해보고 있고, 그 중 NLP, 그 중에서 생성형 인공지능 분야를 중점으로 시도하고 있어요. 성공의 짜릿한 맛, 그리고 실패 했을 때의 두려움을 이겨내고 과거의 제 모습보다 더 나아가기 위해 노력하고 있어요.

  1. 지금까지
    • RAG 기반 질의응답과 생성형 AI 서비스
    • LLM의 서버 환경별 실행·성능 비교
    • 얼굴 생성·시선추적 등 비전 응용
  2. 앞으로
    • 근거로 환각을 줄이는 검색증강·근거 검증
    • 사람과 AI의 상호작용 (Human–AI Interaction)
    • 검색·검증 파이프라인 고도화
work

선별한 연구·개발 작업

2025.04 – 2026.02

RAG 기반 챗봇 커스터마이징 공공 플랫폼

단독 개발 · 시스템 설계 및 배포

27
개 전문대학 운영 중
  1. 배경

    대학·공공기관이 챗봇을 도입할 때마다 중복 개발 비용과 데이터 구축 장벽이 반복됐습니다. 기관마다 처음부터 다시 만드는 구조를 없애고 싶었습니다.

  2. 접근

    기관별 지식베이스 위에서 동작하는 No-code 플랫폼을 설계했습니다. PDF/TXT 업로드 → 자동 전처리·chunking·embedding·ChromaDB 인덱싱 → LLM 질의응답으로 이어지는 RAG 파이프라인을 구현했습니다.

  3. 검증

    별도 정량 평가 대신, 검색 신뢰도가 낮을 때 답을 지어내지 않도록 설계했습니다. 사용자의 질문을 임베딩해 문서 벡터와의 유사도를 계산하고, 유사도가 0.7 미만이면 '해당 질문을 이해하지 못했어요'라고 답해 환각을 차단합니다. 기관별 데이터·프롬프트는 논리적으로 분리하고 감사 로그로 운영 안정성도 확보했습니다.

  4. 성과

    전국 27개 전문대학이 실제 운영에 사용하는 SaaS 형 공공 플랫폼으로 자리 잡았습니다.

한계 · 제언

검색 임계값(0.7)은 경험적으로 정한 값이라 도메인마다 최적값이 다를 수 있고, 답변 정확도·환각률을 정량으로 측정하는 평가 체계는 아직 갖추지 못했습니다. 기관별 QA 세트로 검색·정답 품질을 수치화하고 임계값을 자동 보정하는 것이 다음 과제입니다.

  • Next.js
  • Express.js
  • OpenAI GPT-4.5
  • LangChain
  • ChromaDB
  • MariaDB
  • Docker
2025.07 – 2026.01

미래 직업인 얼굴 생성 (AI 포토부스)

모델 개발 · 서버 유지보수

12
대 체험 장비 설치·운영
  1. 배경

    공개된 얼굴 생성 모델은 서구권 성인 데이터 중심이라, 한국인 아동 얼굴에는 품질이 크게 떨어졌습니다.

  2. 접근

    한국인 아동 얼굴에 특화된 성별별 LoRA 노화 모델을 학습하고, GFPGAN 후처리로 얼굴 복원 품질을 높여 FastAPI 서버로 배포했습니다.

  3. 검증

    1장 생성에 약 40초가 걸렸고, 동일 프롬프트·시드 비교와 정성 평가를 진행했습니다. 아시아권 얼굴은 생성되지만 얼굴 아이덴티티(동일인 식별) 보존에는 한계가 남았고, 나이 노화 표현은 잘 작동하는 것으로 평가됐습니다.

  4. 성과

    한국잡월드 미래체험관 AI 포토존 12대 장비에 설치·운영·유지보수되었습니다.

한계 · 제언

가장 큰 한계는 노화 표현은 자연스럽지만 원본 얼굴의 아이덴티티(동일인 식별)가 보존되지 않는 점이며, 1장당 40초의 생성 시간도 현장 체험에는 다소 길었습니다. 아이덴티티 보존 기법(예: identity-preserving 조건화)과 추론 경량화가 이어질 개선 방향입니다.

  • Diffusion
  • LoRA
  • GFPGAN
  • FastAPI
2023.04 – 2025.03

얼굴인식·시선추적 기반 비대면 시험 부정방지 플랫폼

학생연구원 · 행위기반 탐지(LBDM) 모델 개발

96%
정확도 · RandomForest
  1. 배경

    비대면 시험이 늘면서, 사람이 일일이 감독하지 않고도 부정행위를 자동으로 탐지할 방법이 필요했습니다.

  2. 접근

    웹캠 영상에서 얼굴 랜드마크와 Head Pose(solvePnP)를 추출해 정면 이탈·거리·눈 깜빡임 등 행동 변수를 정의하고, 1분 단위로 집계해 이상 패턴을 탐지하는 LBDM 모델을 만들었습니다.

  3. 검증

    실험자 18명을 대상으로 정상 풀이와 비정상 풀이(검색·핸드폰 보기 등)를 각 15분씩 수집해 약 352개 데이터를 구성했습니다. 전처리 전 기준선 정확도는 신경망 72%, 결정트리 68%, 랜덤포레스트 65%, SVM 58% 수준이었습니다.

  4. 성과

    결측치·이상치를 제거하고 스태킹 앙상블로 모델을 바꾸자 정확도가 랜덤포레스트 96%, 스태킹 100%까지 올랐고, 탐지 이벤트는 GIF 녹화와 로그로 자동 저장해 증거로 남깁니다.

한계 · 제언

실험자 18명·약 352개로 표본이 작아 스태킹 100% 정확도는 과적합 가능성이 큽니다. 더 크고 다양한 피험자 데이터와 교차검증으로 일반화 성능을 확인하고, 조명·기기 등 실제 환경에서의 강건성을 검증하는 것이 필요합니다.

  • MediaPipe
  • OpenCV
  • Pandas
  • scikit-learn
skills

기술 스택

Programming

  • JavaScript / Node.js
  • Python

LLM / RAG

  • LangChain
  • ChromaDB
  • OpenAI API
  • Embedding Retrieval
  • Prompt Engineering

AI / ML

  • PyTorch
  • TensorFlow
  • OpenCV
  • YOLO
  • MediaPipe
  • Diffusion
  • LoRA

Web / Backend

  • Express.js
  • Next.js
  • React
  • FastAPI

Database

  • MariaDB
  • MongoDB

Infra / Tools

  • Docker
  • VMware vSphere
  • OPNsense
  • GPU Server Ops
writing

논문 · 학회 발표

awards

수상

  • 신산업분야특화선도전문대학 우수사례 공모전 우수상 (한국연구재단 이사장상) · 2025.12
  • 신산업분야특화선도전문대학 캡스톤디자인 우수상 · 2025.01
  • 글로벌게임챌린지(GCC) 우수발표상 (한국게임학회) · 2024.11
  • 한국산학기술학회 캡스톤 경진대회 우수상 · 2023.12
  • 학술대회 우수 논문상 5건