Search Ctrl+K
Change language Switch ThemeSign In
Curated Daily BriefWeekly PicksTopics SettingsHelp CenterCollapse
Narrow Mode
SeedRealtime Technical Breakdown: How Full-Modal Full-Duplex Works
SeedRealtime Technical Breakdown: How Full-Modal Full-Duplex Works
 向阳乔木@vista8
SeedRealtime,一个能看懂画面、理解手势、识别物品的全模态全双工交互模型。
现有主流音视频实时交互,要么是多模块级联(ASR 转文字、VLM 理解画面、TTS 合成语音),延迟层层叠加,信息逐级损耗。要么号称端到端,但轮次判断仍然依赖外置 VAD 模块,本质上还是一问一答的半双工逻辑。
用户说话的时候,模型在等。模型说话的时候,用户也在等。
SeedRealtime 将声音、画面、时序与表达纳入到同一个模型实时决策,听、看、理解、推理、说话全在一个模型里。在连续音视频流上,感知、理解、决策与表达同步进行,使听到的和看到的能够参与每次的实时判断。
比如当用户说"这个怎么弄","这个"是什么?在纯语音系统,问题无解。
在 SeedRealtime 里,模型会结合当前画面、用户的手势、视线方向和历史操作,判断"这个"的具体指向。 当遇到同音词或语音模糊时,也能借助视觉场景消除歧义。
这里可以看我的实测,手指着天龙功放按键,模型理解回答,很自然。
据说 OpenAI GPT Live 也只是音频全双工,SeedRealtime 则是全模态(视频、音频、文本)全双工,强啊!Show More
02:45
Aug 6, 2026, 8:14 AM View on X
2 Replies
0 Retweets
2 Likes
2,450 Views  向阳乔木 @vista8
Follow
One Sentence Summary
The author explains how SeedRealtime integrates audio, visuals, timing, and expression into one model for real-time decision-making, unlike cascaded or semi-duplex systems.
Summary
The author breaks down SeedRealtime's architecture, contrasting it with traditional cascaded systems (ASR $\rightarrow$ VLM $\rightarrow$ TTS) which suffer from latency and info loss, or semi-duplex systems relying on external VAD. SeedRealtime processes everything in one model, allowing it to understand references like "how do I do this?" by combining current visuals, gestures, and gaze. The author claims it is "full-modal" (video/audio/text) whereas GPT Live is primarily "audio" full-duplex.
AI Screening
85
Influence Score 3
Published Yesterday
Language
Chinese
Tags
SeedRealtime
Multimodal
Full-Duplex
Audio-Visual Interaction
ByteDance
Make your daily reading actually fit you.A daily brief built from the sources you follow. Get started free HomeDiscoverSettings