Manual/搜索、缓存与执行效率
CRUX 1.0.0 RC1

搜索、缓存与执行效率

理解 Semble、prefix caching 和同轮多工具调用。

Semble 语义搜索

Crux 内置 Semble,可按代码含义寻找相关实现。Agent 可以用 semantic_search 探索项目,再按结果读取具体代码。相较于不断扩大文本搜索范围,相关片段能减少无关内容进入上下文。首次使用可能需要准备模型资源与索引,热启动和首次运行的耗时不同。

text
找到“用户中断之后释放会话占用”的实现,
使用语义搜索定位,再解释关键调用关系。

Prefix caching

Crux 把稳定的系统提示、项目指令等组织成可复用的前缀,减少不必要的变化。服务商支持 prompt cache 时,相同前缀可以复用缓存。界面显示返回的缓存命中信息。

缓存 token 仍是上下文的一部分;缓存命中率不等于“删除了多少上下文”,也不等于相同比例的总费用折扣。更换模型、修改前缀、缓存过期和服务商策略都会影响命中。

项目使用经验中命中率可达 99%,这不是对所有请求的保证,也不是本网站进行的对比基准测试。

同一轮多工具调用

互不依赖的工具调用可在同一轮并行执行,减少模型往返和等待。具有先后依赖的操作仍需顺序执行,例如先读取配置,再根据读取结果修改。

读懂指标

指标含义
TTFT从发起请求到首个 token 的等待时间
tok/s输出生成速率
Token模型报告的输入、输出或上下文用量
Cache hit服务商报告的缓存命中情况
Cost根据已知价格和用量计算的估算值
Coding Plan usage支持的服务商返回的计划额度与剩余量

公平比较

比较效率时固定模型、任务、上下文、机器与网络,分别记录首次运行和后续运行。单轮的高缓存命中率不能代替完整任务的时间与费用测量。

适用于 1.0.0 RC1。示例数字为演示数据。反馈问题