T2D 리스크 스크리너
한국 건강보험공단(NHIS) 건강검진 데이터(약 100만 명)를 기반으로 구축한 보정된 당뇨 스크리닝 도구입니다. 혈당 검사가 필요한 환자를 사전에 플래그하며, 모든 예측에 SHAP 기반 개별 설명을 제공합니다.
그래디언트 부스팅 리스크 모델부터 트랜스포머 NLP, 컴퓨터 비전까지 — 엄밀하고 실제 배포 가능한 머신러닝 시스템을 구축하는 신진 데이터 사이언티스트입니다. Computational & Data Sciences 학사(summa cum laude) 취득, 현재 서울 거주 중입니다.
그래디언트 부스팅 리스크 모델, 트랜스포머 기반 NLP, 컴퓨터 비전, 재사용 가능한 툴링 등 엔드-투-엔드 머신러닝 시스템을 설계·배포합니다. 모델을 실제로 유용하게 만드는 요소 — 정직한 평가, 보정된 확률, 설명 가능성, 그리고 노트북이 아닌 실제 배포 — 에 중점을 둡니다. 조지메이슨대학교(George Mason University) Computational & Data Sciences 학사(summa cum laude) 졸업, 현재 서울 거주 중입니다. 영어 원어민이며 한국어 중급 수준(전직 미군 한국어 언어 전문가)으로, 한국에서 수년간 전문적으로 근무한 경험이 있습니다. 데이터 사이언스·분석, 머신러닝·MLOps, 데이터·백엔드·풀스택 엔지니어링, DevOps, 기술 프로덕트 매니지먼트 등 다양한 데이터·소프트웨어 분야의 직무에 열려 있으며, 특히 헬스케어 및 제약 분야 데이터 분석에 깊은 관심을 갖고 있습니다.
한국 건강보험공단(NHIS) 건강검진 데이터(약 100만 명)를 기반으로 구축한 보정된 당뇨 스크리닝 도구입니다. 혈당 검사가 필요한 환자를 사전에 플래그하며, 모든 예측에 SHAP 기반 개별 설명을 제공합니다.
생의학 도메인 사전학습이 이상반응(ADE) 문장 스크리닝에 측정 가능하지만 제한적인 성능 향상을 가져온다는 것을 엄밀한 어블레이션으로 입증했습니다. 훈련 노이즈와 테스트셋 노이즈를 분리한 쌍체 부트스트랩 신뢰구간(CI)을 활용했습니다.
거리 뷰 이미지를 기반으로 사진의 촬영 국가를 예측하는 파인튜닝 이미지 분류기입니다. 동일한 1,000장 테스트셋에서 사람보다 약 6배 높은 정확도를 달성했습니다(McNemar χ²=444.7, p<0.001).
NetworkX를 확장하는 Python 패키지(PyPI 공개)로, 인터랙티브 Plotly·Sankey 그래프와 FAOSTAT 데이터 기반 GeoPandas 무역 흐름 지도를 제공합니다.