마감 86일 전

[NetsPresso] AI Research Engineer Intern (체험형)
[NetsPresso] AI Research Engineer Intern (체험형)
기업형태
중소기업
접수기간
2026년 07월 24일(금) ~ 2026년 10월 23일(금)
모집직무
AI/ML엔지니어
채용인원
0명
회사위치
서울 강남구 테헤란로 521
근무지역
서울
홈페이지
정보없음
지원방식
접수페이지

상세내용

👋 우리 ​팀을 ​소개합니다.

XPU ​Enabler 팀은 ​NetsPresso의 중·장기 기술 경쟁력을 ​확보하기 ​위한 선행 ​연구(Advanced Research)를 수행합니다.

특히 ​Edge AI ​환경에서 ​최신 AI ​모델을 ​실제 ​디바이스에서 안정적으로 구동하기 ​위한 ​모델 구조 분석, ​최적화 ​전략 ​수립, HW 적합성 ​검증을 주요 ​미션으로 ​삼고 있습니다.

국가 ​주도의 AI ​기술 ​고도화 프로젝트(K-AI 프로젝트, ​정부 R&D ​과제 등)에 참여하여 Edge AI 및 On-device AI 분야의 기술 표준과 방향성을 함께 만들어가고 있습니다.



📌 해당 포지션으로 합류하신다면

당사는 독자 AI Foundation Model 구축 사업의 업스테이지 컨소시엄 참여사로서, 컨소시엄을 통해 개발되는 대규모 언어 모델(LLM) 및 비전-언어 모델(VLM)의 경량화와 추론 최적화를 담당하고 있습니다.

본 포지션은 Foundation Model 자체의 사전학습을 주도하는 역할이 아니라, 개발된 LLM/VLM을 실제 하드웨어 환경에서 효율적으로 구동할 수 있도록 모델을 최적화하는 역할입니다.

모델의 정확도를 최대한 유지하면서 양자화, 프루닝 및 추론 최적화 기술을 적용하고, NVIDIA GPU를 비롯한 국내외 다양한 NPU와 AI 가속기에 모델을 탑재하기 위한 연구 및 소프트웨어 개발을 수행합니다.

특히 Dense 모델뿐만 아니라 Mixture-of-Experts(MoE) 모델의 양자화, 프루닝 및 추론 최적화 기술을 실제 프로젝트에 즉시 적용할 수 있는 연구자·엔지니어를 찾고 있습니다.




✅ 주요 업무

  • 업스테이지 컨소시엄을 통해 개발되는 LLM/VLM Foundation Model의 경량화 및 추론 최적화
  • 대규모 MoE 모델의 양자화 기술 연구·개발
  • Post-Training Quantization(PTQ)
  • Quantization-Aware Training(QAT)
  • 구조적·비구조적 프루닝 및 희소화 기술 연구·개발
  • 양자화·프루닝 과정에서 발생하는 모델 성능 저하를 최소화하기 위한 Calibration, Reconstruction 및 Fine-tuning 방법론 개발
  • TensorRT-LLM, vLLM, SGLang, ONNX Runtime 등 추론 프레임워크 기반 최적화
  • CUDA, Triton 또는 NPU Vendor SDK를 활용한 고성능 연산자와 커널 개발
  • KV Cache 최적화, Continuous/Dynamic Batching, Speculative Decoding 등 추론 가속 기술 개발
  • LLM/VLM의 정확도, Latency, Throughput, Memory Footprint 평가
  • GPU·NPU 탑재 및 추론 최적화
  • 최적화된 LLM/VLM을 NVIDIA GPU 및 다양한 국내외 NPU·AI 가속기에 탑재
  • 각 하드웨어의 연산 구조, 지원 정밀도 및 메모리 특성을 고려한 Hardware-aware Model Optimization
  • GPU와 NPU별 지원 연산자 및 수치 정밀도에 맞춘 모델 변환 및 최적화
  • 하드웨어별 Quantization Scheme, Mixed Precision 및 그래프 최적화 전략 개발
  • 모델 변환, 컴파일, 런타임 연동 및 실제 디바이스 성능 검증
  • 지원되지 않는 연산자에 대한 대체 연산 설계 및 Custom Operator 개발
  • 모델의 End-to-End Latency, Throughput, Memory Usage 및 전력 효율 개선
  • 서버, 온디바이스 및 엣지 환경을 고려한 LLM/VLM 배포 최적화
  • 연구개발
  • LLM/VLM 및 MoE 모델 경량화·추론 최적화 관련 최신 연구 분석
  • 기존 방법론의 한계를 해결하기 위한 신규 양자화, 프루닝 및 추론 최적화 방법론 연구
  • 연구 결과의 특허 출원, 논문 작성 및 국내외 학술대회 발표
  • 개발된 연구 방법론을 실제 GPU·NPU 환경에서 동작하는 소프트웨어로 구현



✅ 기대 역할

  • 컨소시엄에서 개발되는 LLM/VLM Foundation Model을 실제 서비스와 하드웨어 환경에 적용할 수 있는 수준으로 최적화
  • 모델 성능 저하를 최소화하면서 모델 크기, 메모리 사용량 및 연산 비용 절감
  • NVIDIA GPU뿐 아니라 다양한 NPU에서 높은 추론 성능을 확보하기 위한 하드웨어 인지형 최적화 기술 개발
  • MoE 모델에 대한 차세대 양자화·프루닝 기술 연구
  • 연구 결과를 논문이나 프로토타입에 그치지 않고 실제 NPU에서 실행되는 소프트웨어로 구현
  • 다양한 하드웨어를 지원하는 범용 LLM/VLM 최적화 및 배포 기술 체계 구축



✅ 자격요건

  • 컴퓨터공학, 인공지능, 전기전자공학 또는 관련 분야의 석사 이상 학위 보유자 또는 이에 준하는 연구·개발 역량을 보유한 분
  • LLM, VLM 또는 Transformer 기반 모델에 대한 깊은 이해를 보유한 분
  • MoE 모델의 양자화, 프루닝, 희소화 또는 추론 최적화 기술을 실제 프로젝트에 즉시 적용할 수 있는 분
  • 다음 분야 중 하나 이상에서 실질적인 연구 또는 개발 경험을 보유한 분
  • LLM/VLM Quantization
  • Model Pruning 및 Sparsity
  • MoE Compression 및 Routing Optimization
  • Efficient Transformer
  • LLM/VLM Inference Optimization
  • 모델 정확도뿐만 아니라 Latency, Throughput, Memory 및 연산량을 종합적으로 분석할 수 있는 분
  • 연구 방법론을 실제 추론 시스템과 하드웨어 환경에 구현할 수 있는 분
  • 독립적으로 문제를 정의하고 실험을 설계·수행할 수 있는 분
  • 해외 출장 및 여행에 결격 사유가 없는 분



✅ 우대사항

  • NeurIPS, ICML, ICLR, ACL, EMNLP, NAACL, CVPR, ICCV, ECCV 등 최상위 AI·ML 학술대회 논문 게재 경험
  • LLM/VLM 또는 MoE 모델의 양자화·프루닝 관련 논문, 특허 또는 오픈소스 실적
  • GPTQ, AWQ, SmoothQuant, OmniQuant, AutoRound, SparseGPT 등 모델 경량화 기술의 구현 또는 확장 경험
  • TensorRT-LLM, vLLM, SGLang, DeepSpeed, Megatron-LM 등 대규모 모델 추론 시스템 개발 경험
  • CUDA 또는 Triton 기반 GPU 커널 최적화 경험
  • 국내외 NPU, ASIC 또는 Edge AI 가속기 대상 모델 포팅·최적화 경험
  • NPU Vendor SDK, Compiler 또는 Runtime을 이용한 모델 변환 및 배포 경험
  • Custom Operator 또는 Custom Kernel 개발 경험
  • MoE 모델의 Expert Routing, Expert Load Balancing, Expert Parallelism 또는 통신 최적화 경험



✅ 채용 절차

  • 서류 검토 → 과제 → 1차 인터뷰 → 입사 일자 협의 → 최종 선발

(절차 간에 추가적인 과제가 있을 수 있습니다.)



✅ 근무 기간

  • 6개월




🤓 팀의 메세지

우리 팀은 다양한 NPU, GPU, AI 가속기 환경에서 LLM과 Computer Vision 모델이 안정적으로 동작하도록모델 변환부터 그래프 최적화, 벤더 컴파일러 연동, 디바이스 런타임 구성, 배포까지 모델의 전체 생명주기를 설계하고 구현하는 역할을 맡고 있습니다. 하드웨어 제조사가 제공하지 않는 영역, 예를 들면 Front 및 Middle End 최적화, Graph Surgery, 연산자 수정과 같은 부분을 독자적으로 해결하며 어떤 모델이든, 어떤 디바이스 환경에서도 동작 가능하게 만드는 것이 팀의 핵심 미션입니다.




지원 전, 확인해주세요! 👀

  • 해당 공고는 상시 채용으로, 채용 완료 시 조기 마감될 수 있습니다.
  • 이력서 내 연봉 정보 등 민감한 개인 정보가 기재되어 있다면, 해당 서류는 검토되지 않을 수 있습니다.
  • 제출해 주신 내용 중 허위 사실이 있을 경우 채용이 취소될 수 있습니다.
  • 채용 전 레퍼런스 체크가 있음을 알려드립니다.
  • 최종 인터뷰 합격 시 별도로 처우를 협의합니다.
  • 국가보훈대상자 및 장애인은 관련 법규에 의거하여 우대합니다.
  • 장애인 고용 촉진을 위한 행정적 절차 확인이 필요한 경우, 장애인 등록증 사본을 기타 서류 란에 선택적으로 제출하실 수 있습니다. 제출 여부는 전형 평가에 어떠한 영향도 미치지 않습니다.



🔎 읽어보면 도움 되는 관련 자료

자세한 내용은 반드시 해당 홈페이지 또는 직접 문의를 통해 안내 받으세요.

AD


기업문화 엿볼 때, 더팀스

로그인

/