首页 > 资讯 > 合同、案卷、尽调报告越长,显存越吃紧、关键条款越容易丢:APS 想用 ' 拓扑感知压缩 ' 守住长文本的语义结构

合同、案卷、尽调报告越长,显存越吃紧、关键条款越容易丢:APS 想用 ' 拓扑感知压缩 ' 守住长文本的语义结构

36氪文章 2026-10-09 16:39 5 阅读 查看原文

长文本推理的显存压力与专业场景精度矛盾

大语言模型在处理合同、案卷、尽调报告等长文档时,上下文越长,推理显存与计算开销越高。对法务、金融、政务等场景而言,真正的难点不只是“跑得动”,而是“压完之后关键事实还不能丢”。现有不少压缩思路在普通文本上看起来有效,但放到长合同、复杂权属关系、跨段落事实追溯里,模型容易漏掉关键条款或混淆主体关系。

这类场景的用户并不关心模型用了什么花哨能力,只关心三件事:关键信息在不在、推理依据对不对、成本能不能降下来。长文本推理压缩因此从一个工程优化问题,变成专业AI应用能否规模化的前提问题。

APS的拓扑感知压缩思路与已验证结果

APS项目提出的是一条偏底层的长文本推理压缩路线:不把“注意力分数”当作唯一依据,而是在模型完成上下文编码后,从表征层识别信息密度发生明显变化的区域,再以块为单位保留核心上下文并保留必要的缓冲区域,使压缩后的上下文尽量维持原有的语义结构关系。

在工程实现上,APS坚持三件看起来很“硬”的事:压缩后的键值缓存必须按物理方式重组;每个被保留的上下文片段都必须携带它在原始文本中的真实位置信息;生成阶段的位置编码与注意力掩码必须严格对齐。这样做的目的只有一个——让模型在上下文被裁掉一半时,仍然知道“哪句话原本在文档的什么位置”,从而避免长文本关系被压塌。

在Qwen2.5-7B、32K上下文、50%键值缓存压缩的实验设定下,APS在长文本关键信息检索任务中取得9/9的结果;在十五项法务探针测试中,APS与全量未压缩基线持平,优于随机裁剪方案。更关键的是场景侧反馈:通义法睿生态服务商技术团队使用真实法务语料进行测试后,认为APS在长文档关键信息提取上具备“绝对优势”,并表示若项目方有合作意愿,可进一步沟通合作形式。

团队背景、技术保护与现阶段进展

APS由具备法律与人工智能交叉背景的团队推进。创始人毕业于美国印第安纳大学法学院,曾任多家世界500强企业法务总监,长期处理合同审查、知识产权、合规与争议解决等高频长文本任务,对“法务场景里哪些信息不能丢”有直接接触。

技术保护上,APS核心算法未走公开专利路线,而是以商业秘密方式保护。项目方判断,在极早期阶段,过早披露实现细节不利于技术壁垒维持;后续是否申请专利,将视合作模式、授权范围和商业化路径再定。

现阶段,APS已完成核心思路的工程验证与初步评测,尚未设立融资主体,正以技术验证结果和场景反馈为基础寻求种子轮支持。资金若到位,将主要用于工程化封装、评测体系完善、场景方联合验证以及公司主体设立。项目方更看重的,不是单纯拿到一笔钱,而是找到能理解长文本推理基础设施价值、愿意先用真实业务语料共同验证的产业方或早期投资人。

长文本推理压缩不会是短期热点里的“又一个AI故事”。随着企业级应用从聊天走向合同、案件、研报、监管文件等真实长文档,推理成本与信息保真会成为AI能不能进生产系统的分水岭。APS目前展示出���,不是已经跑完的商业闭环,而是一个被场景方认为“有绝对优势”的技术方向,以及一套在高压缩比下尽量不让语义结构坍塌的方法论。