切换·Esc 返回

流式响应Streaming Response

AI 概念
流式响应是服务器把生成结果分成连续片段发送、界面逐段显示的传输方式例如,聊天回答会像打字一样逐段出现。首段更早可见不代表整份回答更早完成,总时长仍受后续生成和传输影响。
也常被叫作Streaming流式输出
开始前

见过聊天回答逐字或逐段出现。

看完后

能判断首段出现得快,与完整回答总时长是两回事。

同一段回答怎样从事件片段变成聊天气泡
0.8s · 首段3.2s · 完成
AI

内容会显示在这里…

等待首段
event 1event 2event 3event 4event 5

首段更早出现,改善的是等待感;完整回答什么时候结束,要看后续片段多久到齐。

刚才发生了什么
  1. 1
    片段抵达

    服务连续发来文字或状态事件,单个片段不一定是完整的一个词。

  2. 2
    界面追加

    产品按顺序把每个文字片段接在已有内容后面。

  3. 3
    等待仍在继续

    首段先出现能减轻等待感,但总时长仍取决于后续生成和传输。

别带走这个误解

流式展示主要让内容更早可见,不会自动让模型更快完成整段回答。

接下来学什么