适用场景与历史记录
原议题建议参考 Open WebUI Call Mode,把实时语音与图像输入结合。 原始讨论提交于 2024-10-09,本页按该记录说明症状或需求的适用范围。
已有证据与适用范围
当前文件输入和语音配置文档提供相关基础能力;连续录音、实时双向传输和图像联合处理各有独立适配条件。
排查与复测
- 明确实时交互所需的输入形式、响应延迟、打断和图像时序。
- 分别验证语音输入、自动语音回复和模型图像识别。
- 组合测试时记录每一轮媒体、转写和响应时间,再按差距提出具体需求。
这些检查用于复现和验证同类场景。继续反馈时,提供准确版本、最小输入、预期结果和脱敏日志,并引用原始讨论。
参考资料
来源: FastGPT 语音输入