스타트업 뉴스AI타임스2026년 9월 19일
알리바바, 보고 듣고 행동하는 옴니모달 '큐원3.8-옴니-플래시' 공개
알리바바가 오디오와 비디오를 이해하는 데 그치지 않고 사용자의 지시에 따라 도구를 호출하고 작업까지 수행할 수 있는 차세대 옴니모달 모델을 공개했다. 알리바바는 18일(현지시간) 단순한 콘텐츠 인식을 넘어 작업 계획과 실행이 가능한 새로운 옴니모달 모델 ‘큐원3.8-옴니-플래시(Qwen3.8-Omni-Flash)’를 공개했다.텍스트와 이미지뿐 아니라 오디오와 비디오를 입력으로 처리하며, 최대 100만 토큰의 컨텍스트를 지원한다. 출력은 텍스트 형태로 제공되지만 함수 호출과 웹 검색, 구조화된 출력, 컨텍스트 캐싱, 배치 호출 등을