流式响应Streaming Response
AI 概念流式响应是服务器把生成结果分成连续片段发送、界面逐段显示的传输方式例如,聊天回答会像打字一样逐段出现。首段更早可见不代表整份回答更早完成,总时长仍受后续生成和传输影响。
也常被叫作Streaming流式输出
开始前
见过聊天回答逐字或逐段出现。
看完后
能判断首段出现得快,与完整回答总时长是两回事。
同一段回答怎样从事件片段变成聊天气泡
0.8s · 首段3.2s · 完成
AI
内容会显示在这里…
等待首段event 1event 2event 3event 4event 5
首段更早出现,改善的是等待感;完整回答什么时候结束,要看后续片段多久到齐。
刚才发生了什么
- 1片段抵达
服务连续发来文字或状态事件,单个片段不一定是完整的一个词。
- 2界面追加
产品按顺序把每个文字片段接在已有内容后面。
- 3等待仍在继续
首段先出现能减轻等待感,但总时长仍取决于后续生成和传输。
流式展示主要让内容更早可见,不会自动让模型更快完成整段回答。
接下来学什么