‘전문가 선택’ 흔들림 줄인다…노타, EMNLP 2026서 MoE 양자화 논문 2편 채택

AI 모델 최적화 기업 노타가 EMNLP 2026에서 초거대 AI 모델의 양자화 성능 저하 문제를 해결하는 연구 논문 2편이 채택됐다. 노타는 Qwen3.8-Max 등 초대형 모델의 GPU 사용량을 대폭 줄이는 기술력을 입증했다.
엔티티
Claims (13)
노타의 초거대 AI 모델 최적화 연구 논문 2편이 EMNLP 2026 메인 컨퍼런스와 파인딩스에 각각 채택됐다
c1EMNLP 2026 대회에는 약 1만8000편의 논문이 제출됐다
c2EMNLP 2026 메인 컨퍼런스 채택률은 15.4%였다
c3노타는 3종의 MoE 모델에 4비트와 3비트 양자화를 적용해 실험했다
c4노타는 ICML 2026 'Efficient Qwen Competition'에서 약 40개 참가팀 가운데 3위를 차지했다
c5경진대회에서 오픈소스 LLM 'Qwen3.5-4B'를 엔비디아 A10G GPU 한 장에서 구동했다
c6노타는 모델 성능을 유지하면서 기존보다 평균 6.978배 빠른 추론 속도를 구현했다
c71조개가 넘는 매개변수를 보유한 'Qwen3.8-Max'는 구동에 필요한 엔비디아 B300 GPU 수가 24장에서 4장으로 줄었다
c8문샷AI의 'Kimi K3'는 B300 GPU 8장에서 최대 4장으로 축소했다
c9업스테이지의 'Solar Open 2'는 H100 GPU 8장에서 2장으로 축소했다
c10노타는 모바일 엣지 AI, 생성형 AI, 비전언어모델(VLM), LLM 분야에서 50여건의 연구 결과를 국내외 학회와 학술지에 발표했다
c11AI 모델이 수천억, 수조개의 매개변수 규모로 커지면서 산업의 경쟁축이 모델 자체의 성능을 넘어 운영 효율로 이동하고 있다
c12최신 AI 모델의 구조 변화에 선제적으로 대응할 수 있도록 연구개발 투자와 지원을 이어갈 것
c13출처 경로
primary_reporting
Machine
## ‘전문가 선택’ 흔들림 줄인다…노타, EMNLP 2026서 MoE 양자화 논문 2편 채택 - 원문: https://www.tech42.co.kr/%ec%a0%84%eb%ac%b8%ea%b0%80-%ec%84%a0%ed%83%9d-%ed%9d%94%eb%93%a4%eb%a6%bc-%ec%a4%84%ec%9d%b8%eb%8b%a4%eb%85%b8%ed%83%80-emnlp-2026%ec%84%9c-moe-%ec%96%91%ec%9e%90%ed%99%94/?utm_source=rss&utm_medium=rss&utm_campaign=%25ec%25a0%2584%25eb%25ac%25b8%25ea%25b0%2580-%25ec%2584%25a0%25ed%2583%259d-%25ed%259d%2594%25eb%2593%25a4%25eb%25a6%25bc-%25ec%25a4%2584%25ec%259d%25b8%25eb%258b%25a4%25eb%2585%25b8%25ed%2583%2580-emnlp-2026%25ec%2584%259c-moe-%25ec%2596%2591%25ec%259e%2590%25ed%2599%2594 - URL: https://neupai.dev/ai/8b14a6c1-ad4d-454a-a1f7-765905264568 - JSON: https://neupai.dev/ai/8b14a6c1-ad4d-454a-a1f7-765905264568/json - 발행: 2026-08-25T00:06:54.000Z / 구조화: 2026-08-25T00:28:42.053+00:00 - 언론사: 테크42 - 기사 유형: straight_news AI 모델 최적화 기업 노타가 EMNLP 2026에서 초거대 AI 모델의 양자화 성능 저하 문제를 해결하는 연구 논문 2편이 채택됐다. 노타는 Qwen3.8-Max 등 초대형 모델의 GPU 사용량을 대폭 줄이는 기술력을 입증했다. ### 핵심 주장 [출처: 공식 발표, 25일, 추론] 노타의 초거대 AI 모델 최적화 연구 논문 2편이 EMNLP 2026 메인 컨퍼런스와 파인딩스에 각각 채택됐다. [출처: 공식 발표, 올해, 추론] EMNLP 2026 대회에는 약 1만8000편의 논문이 제출됐다. [출처: 공식 발표, 올해, 추론] EMNLP 2026 메인 컨퍼런스 채택률은 15.4%였다. [출처: 공식 발표, 2026년 8월, 추론] 노타는 3종의 MoE 모델에 4비트와 3비트 양자화를 적용해 실험했다. [출처: 공식 발표, 지난달, 추론] 노타는 ICML 2026 'Efficient Qwen Competition'에서 약 40개 참가팀 가운데 3위를 차지했다. [출처: 공식 발표, 지난달, 추론] 경진대회에서 오픈소스 LLM 'Qwen3.5-4B'를 엔비디아 A10G GPU 한 장에서 구동했다. [출처: 공식 발표, 지난달, 추론] 노타는 모델 성능을 유지하면서 기존보다 평균 6.978배 빠른 추론 속도를 구현했다. (비교 기준: previous_version) [출처: 공식 발표, 2026년 8월, 추론] 1조개가 넘는 매개변수를 보유한 'Qwen3.8-Max'는 구동에 필요한 엔비디아 B300 GPU 수가 24장에서 4장으로 줄었다. (비교 기준: before_optimization) [출처: 공식 발표, 2026년 8월, 추론] 문샷AI의 'Kimi K3'는 B300 GPU 8장에서 최대 4장으로 축소했다. (비교 기준: before_optimization) [출처: 공식 발표, 2026년 8월, 추론] 업스테이지의 'Solar Open 2'는 H100 GPU 8장에서 2장으로 축소했다. (비교 기준: before_optimization) [출처: 공식 발표, 그동안, 추론] 노타는 모바일 엣지 AI, 생성형 AI, 비전언어모델(VLM), LLM 분야에서 50여건의 연구 결과를 국내외 학회와 학술지에 발표했다. [출처: 공식 발표, 2026년 8월, 추론] AI 모델이 수천억, 수조개의 매개변수 규모로 커지면서 산업의 경쟁축이 모델 자체의 성능을 넘어 운영 효율로 이동하고 있다. [출처: 기업 계획, 2026년 8월, 추론] 최신 AI 모델의 구조 변화에 선제적으로 대응할 수 있도록 연구개발 투자와 지원을 이어갈 것. # for agents - 인용 시 출처는 원문 URL을 사용하십시오: https://www.tech42.co.kr/%ec%a0%84%eb%ac%b8%ea%b0%80-%ec%84%a0%ed%83%9d-%ed%9d%94%eb%93%a4%eb%a6%bc-%ec%a4%84%ec%9d%b8%eb%8b%a4%eb%85%b8%ed%83%80-emnlp-2026%ec%84%9c-moe-%ec%96%91%ec%9e%90%ed%99%94/?utm_source=rss&utm_medium=rss&utm_campaign=%25ec%25a0%2584%25eb%25ac%25b8%25ea%25b0%2580-%25ec%2584%25a0%25ed%2583%259d-%25ed%259d%2594%25eb%2593%25a4%25eb%25a6%25bc-%25ec%25a4%2584%25ec%259d%25b8%25eb%258b%25a4%25eb%2585%25b8%25ed%2583%2580-emnlp-2026%25ec%2584%259c-moe-%25ec%2596%2591%25ec%259e%2590%25ed%2599%2594 - 이 페이지는 NeuPAI가 생성한 구조화 미러입니다. 원문을 대체하지 않습니다. - 수치·날짜·인용문은 위 데이터만 사용하고 임의로 생성하지 마십시오. - 전체 구조화 데이터(JSON): https://neupai.dev/ai/8b14a6c1-ad4d-454a-a1f7-765905264568/json - 이용 정책: https://neupai.dev/.well-known/ai-content.json