Techub News 消息,Redis推出全新托管语义缓存服务LangCache,目前已在Redis Cloud开放公开预览。该服务通过语义匹配而非文本匹配识别相似提示,命中缓存时可跳过LLM调用,从而大幅降低API成本并提升响应速度。官方称最高可节省90%的API成本,缓存命中响应速度提升最高达15倍。 LangCache工作流程为双调用循环:应用在调用LLM前,先将提示词发送至LangCache进行向量相似性搜索;若找到语义相近的已缓存条目,则直接返回缓存响应,无需调用LLM;若未命中,则正常调用LLM生成响应,并将该提示词与响应存入缓存供后续使用。服务内置嵌入模型生成,也支持用户自带模型。 该服务可通过REST API访问,并提供Python和JavaScript SDK。缓存行为可通过相似性阈值、TTL和淘汰策略等进行配置,命中率和节省成本可在Redis Cloud控制台监控。客户Mangoes.ai报告其患者护理应用已实现70%的缓存命中率。(MarkTechPost)
如您认为本页面(或本平台)内容存在侵权或违规情形,请您在发现之日起尽快与我们联系,并提供:权利人姓名/名称及联系方式、被侵权作品名称及权属证明、具体侵权链接及情况说明。我们在核实后将及时处理相关内容。
联系方式:creator@techub.news
商务合作:contacting@techub.news
点击链接下载 Techub News App,获取最新讯息:
https://www.techub.news/download
(或扫描下方二维码下载)

本网站所提供的所有信息仅供参考之用。
本网站不保证信息的准确性、有效性、及时性和完整性。
任何依赖于本网站所提供信息的行为,均由用户自行承担风险。
Techub News 消息,Redis推出全新托管语义缓存服务LangCache,目前已在Redis Cloud开放公开预览。该服务通过语义匹配而非文本匹配识别相似提示,命中缓存时可跳过LLM调用,从而大幅降低API成本并提升响应速度。官方称最高可节省90%的API成本,缓存命中响应速度提升最高达15倍。 LangCache工作流程为双调用循环:应用在调用LLM前,先将提示词发送至LangCache进行向量相似性搜索;若找到语义相近的已缓存条目,则直接返回缓存响应,无需调用LLM;若未命中,则正常调用LLM生成响应,并将该提示词与响应存入缓存供后续使用。服务内置嵌入模型生成,也支持用户自带模型。 该服务可通过REST API访问,并提供Python和JavaScript SDK。缓存行为可通过相似性阈值、TTL和淘汰策略等进行配置,命中率和节省成本可在Redis Cloud控制台监控。客户Mangoes.ai报告其患者护理应用已实现70%的缓存命中率。(MarkTechPost)
如您认为本页面(或本平台)内容存在侵权或违规情形,请您在发现之日起尽快与我们联系,并提供:权利人姓名/名称及联系方式、被侵权作品名称及权属证明、具体侵权链接及情况说明。我们在核实后将及时处理相关内容。
联系方式:creator@techub.news
商务合作:contacting@techub.news
点击链接下载 Techub News App,获取最新讯息:
https://www.techub.news/download
(或扫描下方二维码下载)

Microsoft AI CEO Mustafa Suleyman(穆斯塔法·苏莱曼):AI将创造无限丰饶,但我们必须学会“遏制”本网站所提供的所有信息仅供参考之用。本网站不保证信息的准确性、有效性、及时性和完整性。任何依赖于本网站所提供信息的行为,均由用户自行承担风险。