스타트업 뉴스AI타임스2026년 7월 26일
엔비디아, LLM 배포 가속 '모델익스프레스' 발표..."서버 대기 8분에서 1분대로 단축"
대형언어모델(LLM)의 규모가 테라바이트(TB)에 이르면서 모델 가중치를 이동하는 시간이 AI 서비스의 새로운 병목으로 떠오르고 있다. 엔비디아가 이러한 문제를 해결하기 위해 GPU 간 직접 전송 기술을 활용한 새로운 모델 배포 인프라를 공개했다. 엔비디아는 24일(현지시간) LLM의 배포와 확장, 강화학습(RL) 사후학습 과정에서 발생하는 모델 가중치 이동을 최적화하는 소프트웨어 인프라 ‘모델익스프레스(ModelExPress)’를 발표했다.AI 모델의 규모가 테라바이트(TB) 수준으로 커지면서, 새로운 AI 서버를 켤 때마다 모델