Χ

추천 검색어

최근 검색어

(주)노타

AI for everyone, everywhere
AI를 누구에게나, 어디에서나

노타는 AI 최적화 기술을 통해 AI의 일상화를 선도하는 기업입니다.

우리는 다양한 디바이스와 산업 전반에 걸쳐, 누구나 어디서나 AI를 사용할 수 있는 세상을 만들고자 합니다.

노타의 핵심 제품인 넷츠프레소(NetsPresso)는 하드웨어의 특성을 이해하는 AI 모델 최적화 플랫폼입니다. 또한, 차세대 영상 관제 솔루션 (NVA: Nota Vision Agent), 지능형 교통 시스템(ITS) 등 온디바이스 생성형 AI 솔루션을 통해 실제 산업 현장에서의 AI 실현 가능성을 넓히고 있습니다.

국내 스타트업으로는 최초로 삼성과 LG의 투자 유치 기록을 보유하고 있으며, 네이버 DS2F의 첫 투자 기업이기도 합니다. 최근에는 두바이 교통국과의 AI 솔루션 공급 계약을 체결하고, CB Insights AI 100에도 선정되는 등 글로벌 무대에서의 성과를 이어가고 있습니다.

노타는 빠르게 성장하는 조직과 함께할 다양한 직군의 노타 크루를 찾고 있습니다. 직급과 경력에 관계없이 누구나 동등한 입장에서 의견을 나눌 수 있는 수평적인 문화 속에서, 공동의 목표를 향해 자율적으로 일할 수 있는 분과 함께하고 싶습니다.

누구나, 어디에서나 AI의 가치를 경험할 수 있도록 하는 여정, 지금 노타에서 함께하세요.
서울시 강남구 테헤란로 521  파르나스타워 16층 Nota  
서울시 강남구 테헤란로 521파르나스타워 16층 Nota  
AI for everyone, everywhere
AI를 누구에게나, 어디에서나

노타는 AI 최적화 기술을 통해 AI의 일상화를 선도하는 기업입니다.

우리는 다양한 디바이스와 산업 전반에 걸쳐, 누구나 어디서나 AI를 사용할 수 있는 세상을 만들고자 합니다.

노타의 핵심 제품인 넷츠프레소(NetsPresso)는 하드웨어의 특성을 이해하는 AI 모델 최적화 플랫폼입니다. 또한, 차세대 영상 관제 솔루션 (NVA: Nota Vision Agent), 지능형 교통 시스템(ITS) 등 온디바이스 생성형 AI 솔루션을 통해 실제 산업 현장에서의 AI 실현 가능성을 넓히고 있습니다.

국내 스타트업으로는 최초로 삼성과 LG의 투자 유치 기록을 보유하고 있으며, 네이버 DS2F의 첫 투자 기업이기도 합니다. 최근에는 두바이 교통국과의 AI 솔루션 공급 계약을 체결하고, CB Insights AI 100에도 선정되는 등 글로벌 무대에서의 성과를 이어가고 있습니다.

노타는 빠르게 성장하는 조직과 함께할 다양한 직군의 노타 크루를 찾고 있습니다. 직급과 경력에 관계없이 누구나 동등한 입장에서 의견을 나눌 수 있는 수평적인 문화 속에서, 공동의 목표를 향해 자율적으로 일할 수 있는 분과 함께하고 싶습니다.

누구나, 어디에서나 AI의 가치를 경험할 수 있도록 하는 여정, 지금 노타에서 함께하세요.

지원분야

모집부문
[NetsPresso] AI Research Engineer Intern (체험형)
고용형태
인턴

지원서접수

접수기간
07월 24일 ~ 채용시마감
문의처
[email protected]   

👋 우리 ​팀을 ​소개합니다.

XPU ​Enabler 팀은 ​NetsPresso의 중·장기 기술 경쟁력을 ​확보하기 ​위한 선행 ​연구(Advanced Research)를 수행합니다.

특히 ​Edge AI ​환경에서 ​최신 AI ​모델을 ​실제 ​디바이스에서 안정적으로 구동하기 ​위한 ​모델 구조 분석, ​최적화 ​전략 ​수립, HW 적합성 ​검증을 주요 ​미션으로 ​삼고 있습니다.

국가 ​주도의 AI ​기술 ​고도화 프로젝트(K-AI 프로젝트, ​정부 R&D ​과제 등)에 참여하여 Edge AI 및 On-device AI 분야의 기술 표준과 방향성을 함께 만들어가고 있습니다.

 

 

📌 해당 포지션으로 합류하신다면

당사는 독자 AI Foundation Model 구축 사업의 업스테이지 컨소시엄 참여사로서, 컨소시엄을 통해 개발되는 대규모 언어 모델(LLM) 및 비전-언어 모델(VLM)의 경량화와 추론 최적화를 담당하고 있습니다.

본 포지션은 Foundation Model 자체의 사전학습을 주도하는 역할이 아니라, 개발된 LLM/VLM을 실제 하드웨어 환경에서 효율적으로 구동할 수 있도록 모델을 최적화하는 역할입니다.

모델의 정확도를 최대한 유지하면서 양자화, 프루닝 및 추론 최적화 기술을 적용하고, NVIDIA GPU를 비롯한 국내외 다양한 NPU와 AI 가속기에 모델을 탑재하기 위한 연구 및 소프트웨어 개발을 수행합니다.

특히 Dense 모델뿐만 아니라 Mixture-of-Experts(MoE) 모델의 양자화, 프루닝 및 추론 최적화 기술을 실제 프로젝트에 즉시 적용할 수 있는 연구자·엔지니어를 찾고 있습니다.

 

 

 

✅ 주요 업무

  • 업스테이지 컨소시엄을 통해 개발되는 LLM/VLM Foundation Model의 경량화 및 추론 최적화
  • 대규모 MoE 모델의 양자화 기술 연구·개발
  • Post-Training Quantization(PTQ)
  • Quantization-Aware Training(QAT)
  • 구조적·비구조적 프루닝 및 희소화 기술 연구·개발
  • 양자화·프루닝 과정에서 발생하는 모델 성능 저하를 최소화하기 위한 Calibration, Reconstruction 및 Fine-tuning 방법론 개발
  • TensorRT-LLM, vLLM, SGLang, ONNX Runtime 등 추론 프레임워크 기반 최적화
  • CUDA, Triton 또는 NPU Vendor SDK를 활용한 고성능 연산자와 커널 개발
  • KV Cache 최적화, Continuous/Dynamic Batching, Speculative Decoding 등 추론 가속 기술 개발
  • LLM/VLM의 정확도, Latency, Throughput, Memory Footprint 평가
  • GPU·NPU 탑재 및 추론 최적화
  • 최적화된 LLM/VLM을 NVIDIA GPU 및 다양한 국내외 NPU·AI 가속기에 탑재
  • 각 하드웨어의 연산 구조, 지원 정밀도 및 메모리 특성을 고려한 Hardware-aware Model Optimization
  • GPU와 NPU별 지원 연산자 및 수치 정밀도에 맞춘 모델 변환 및 최적화
  • 하드웨어별 Quantization Scheme, Mixed Precision 및 그래프 최적화 전략 개발
  • 모델 변환, 컴파일, 런타임 연동 및 실제 디바이스 성능 검증
  • 지원되지 않는 연산자에 대한 대체 연산 설계 및 Custom Operator 개발
  • 모델의 End-to-End Latency, Throughput, Memory Usage 및 전력 효율 개선
  • 서버, 온디바이스 및 엣지 환경을 고려한 LLM/VLM 배포 최적화
  • 연구개발
  • LLM/VLM 및 MoE 모델 경량화·추론 최적화 관련 최신 연구 분석
  • 기존 방법론의 한계를 해결하기 위한 신규 양자화, 프루닝 및 추론 최적화 방법론 연구
  • 연구 결과의 특허 출원, 논문 작성 및 국내외 학술대회 발표
  • 개발된 연구 방법론을 실제 GPU·NPU 환경에서 동작하는 소프트웨어로 구현

 

 

✅ 기대 역할

  • 컨소시엄에서 개발되는 LLM/VLM Foundation Model을 실제 서비스와 하드웨어 환경에 적용할 수 있는 수준으로 최적화
  • 모델 성능 저하를 최소화하면서 모델 크기, 메모리 사용량 및 연산 비용 절감
  • NVIDIA GPU뿐 아니라 다양한 NPU에서 높은 추론 성능을 확보하기 위한 하드웨어 인지형 최적화 기술 개발
  • MoE 모델에 대한 차세대 양자화·프루닝 기술 연구
  • 연구 결과를 논문이나 프로토타입에 그치지 않고 실제 NPU에서 실행되는 소프트웨어로 구현
  • 다양한 하드웨어를 지원하는 범용 LLM/VLM 최적화 및 배포 기술 체계 구축

 

 

✅ 자격요건

  • 컴퓨터공학, 인공지능, 전기전자공학 또는 관련 분야의 석사 이상 학위 보유자 또는 이에 준하는 연구·개발 역량을 보유한 분
  • LLM, VLM 또는 Transformer 기반 모델에 대한 깊은 이해를 보유한 분
  • MoE 모델의 양자화, 프루닝, 희소화 또는 추론 최적화 기술을 실제 프로젝트에 즉시 적용할 수 있는 분
  • 다음 분야 중 하나 이상에서 실질적인 연구 또는 개발 경험을 보유한 분
  • LLM/VLM Quantization
  • Model Pruning 및 Sparsity
  • MoE Compression 및 Routing Optimization
  • Efficient Transformer
  • LLM/VLM Inference Optimization
  • 모델 정확도뿐만 아니라 Latency, Throughput, Memory 및 연산량을 종합적으로 분석할 수 있는 분
  • 연구 방법론을 실제 추론 시스템과 하드웨어 환경에 구현할 수 있는 분
  • 독립적으로 문제를 정의하고 실험을 설계·수행할 수 있는 분
  • 해외 출장 및 여행에 결격 사유가 없는 분

 

 

✅ 우대사항

  • NeurIPS, ICML, ICLR, ACL, EMNLP, NAACL, CVPR, ICCV, ECCV 등 최상위 AI·ML 학술대회 논문 게재 경험
  • LLM/VLM 또는 MoE 모델의 양자화·프루닝 관련 논문, 특허 또는 오픈소스 실적
  • GPTQ, AWQ, SmoothQuant, OmniQuant, AutoRound, SparseGPT 등 모델 경량화 기술의 구현 또는 확장 경험
  • TensorRT-LLM, vLLM, SGLang, DeepSpeed, Megatron-LM 등 대규모 모델 추론 시스템 개발 경험
  • CUDA 또는 Triton 기반 GPU 커널 최적화 경험
  • 국내외 NPU, ASIC 또는 Edge AI 가속기 대상 모델 포팅·최적화 경험
  • NPU Vendor SDK, Compiler 또는 Runtime을 이용한 모델 변환 및 배포 경험
  • Custom Operator 또는 Custom Kernel 개발 경험
  • MoE 모델의 Expert Routing, Expert Load Balancing, Expert Parallelism 또는 통신 최적화 경험

 

 

✅ 채용 절차

  • 서류 검토 → 과제 → 1차 인터뷰 → 입사 일자 협의 → 최종 선발

(절차 간에 추가적인 과제가 있을 수 있습니다.)

 

 

✅ 근무 기간

  • 6개월

 

 

 

🤓 팀의 메세지

우리 팀은 다양한 NPU, GPU, AI 가속기 환경에서 LLM과 Computer Vision 모델이 안정적으로 동작하도록모델 변환부터 그래프 최적화, 벤더 컴파일러 연동, 디바이스 런타임 구성, 배포까지 모델의 전체 생명주기를 설계하고 구현하는 역할을 맡고 있습니다. 하드웨어 제조사가 제공하지 않는 영역, 예를 들면 Front 및 Middle End 최적화, Graph Surgery, 연산자 수정과 같은 부분을 독자적으로 해결하며 어떤 모델이든, 어떤 디바이스 환경에서도 동작 가능하게 만드는 것이 팀의 핵심 미션입니다.

 

 

 

지원 전, 확인해주세요! 👀

  • 해당 공고는 상시 채용으로, 채용 완료 시 조기 마감될 수 있습니다.
  • 이력서 내 연봉 정보 등 민감한 개인 정보가 기재되어 있다면, 해당 서류는 검토되지 않을 수 있습니다.
  • 제출해 주신 내용 중 허위 사실이 있을 경우 채용이 취소될 수 있습니다.
  • 채용 전 레퍼런스 체크가 있음을 알려드립니다.
  • 최종 인터뷰 합격 시 별도로 처우를 협의합니다.
  • 국가보훈대상자 및 장애인은 관련 법규에 의거하여 우대합니다.
  • 장애인 고용 촉진을 위한 행정적 절차 확인이 필요한 경우, 장애인 등록증 사본을 기타 서류 란에 선택적으로 제출하실 수 있습니다. 제출 여부는 전형 평가에 어떠한 영향도 미치지 않습니다.

 

 

🔎 읽어보면 도움 되는 관련 자료

* 마감일은 기업의 사정으로 인해 조기 마감 또는 변경될 수 있습니다
접수기간
07월 24일 17:00 시작
채용시마감

더보기

기업 탐색하기 🔍