스타트업 뉴스ZDNet Korea2026년 8월 7일
바이트댄스, 보면서 듣고 먼저 말 거는 AI…'시드리얼타임' 더우바오에 전면 적용
[지디넷코리아]바이트댄스가 음성과 영상, 텍스트를 하나의 모델에서 동시에 처리하는 시드리얼타임(SeedRealtime)을 공개했다. 현지 시각 8월 5일 바이트댄스 시드(Seed) 팀이 공식 블로그에 게시한 발표다.전이중(full-duplex)은 전화처럼 양쪽이 동시에 말하고 들을 수 있는 방식을 가리킨다. 기존 음성 AI는 음성 인식과 언어 모델, 음성 합성을 차례로 이어 붙이는 구조여서 상대가 말을 끝낼 때까지 기다려야 했다. 시드리얼타임은 이 과정을 하나의 아키텍처로 합쳐, 끊이지 않고 들어오는 음성·영상 스트림 위에서 인식과 이해, 판단, 발화가 나란히 돌아가게 만들었다.바이트댄스는 세 가지 기능을 내세웠다. 먼저 소리와 화면을 함께 이해한다. 발음이 같아 뜻이 갈리는 말을 눈에 보이는 맥락으로 가려내고, "아까 그거"처럼 시점을 가리키는 표현도 해석한다. 다음으로 먼저 말을 건다. 화면이 바뀌면 이용자가 묻기 전에 모델이 먼저 반응하고, 그러면서 도구 호출도 함께 처리한다.