Shopify工程团队日前发布了一项名为Gisting的新技术,用于将大语言模型(LLM)的冗长系统提示词压缩为少量可学习的“要点”令牌(gist tokens),从而提升吞吐量并降低推理成本。该技术由Shopify工程师Sergio De Simone对外公布,主要面向企业级LLM应用中提示词工程带来的算力开销问题。
在实际的LLM部署场景中,系统提示词(system prompts)通常包含大量指令性文本,这些内容在每次推理请求中都会被重复处理,消耗大量计算资源。Gisting的核心思路是训练模型将这类固定提示词编码为更紧凑的表示形式,在推理阶段仅需处理压缩后的令牌序列,而非完整的原始提示词,从而减少注意力机制的计算负担。
Shopify方面表示,Gisting在实验中能够在保持输出质量基本不变的前提下,实现显著的吞吐量提升和单位推理成本下降。这一技术对于高频调用LLM接口的企业级应用尤其具有价值,因为系统提示词往往占据请求上下文的较大比例,压缩后可直接转化为GPU算力与延迟方面的收益。
作为全球领先的电商SaaS平台,Shopify近年来持续将AI能力嵌入其商家服务生态,包括智能客服、营销文案生成、商品描述自动化等场景。此次推出的Gisting技术并非面向终端用户的产品功能,而是属于其底层AI基础设施的优化手段,反映出平台型SaaS企业在规模化落地LLM应用时对推理成本控制的关注。
从行业视角看,提示词压缩正成为LLM工程化落地中的一个重要研究方向。除Shopify外,学术界与多家AI基础设施公司也在探索类似的技术路径,包括提示词蒸馏、上下文缓存和稀疏注意力等方案。随着企业级AI应用从概念验证走向生产环境,推理效率与成本结构将直接影响SaaS产品的定价能力和利润空间,Gisting这类底层优化技术的价值预计将逐步显现。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。