搜索、缓存与执行效率
理解 Semble、prefix caching 和同轮多工具调用。
Semble 语义搜索
Crux 内置 Semble,可按代码含义寻找相关实现。Agent 可以用 semantic_search 探索项目,再按结果读取具体代码。相较于不断扩大文本搜索范围,相关片段能减少无关内容进入上下文。首次使用可能需要准备模型资源与索引,热启动和首次运行的耗时不同。
找到“用户中断之后释放会话占用”的实现,
使用语义搜索定位,再解释关键调用关系。Prefix caching
Crux 把稳定的系统提示、项目指令等组织成可复用的前缀,减少不必要的变化。服务商支持 prompt cache 时,相同前缀可以复用缓存。界面显示返回的缓存命中信息。
缓存 token 仍是上下文的一部分;缓存命中率不等于“删除了多少上下文”,也不等于相同比例的总费用折扣。更换模型、修改前缀、缓存过期和服务商策略都会影响命中。
项目使用经验中命中率可达 99%,这不是对所有请求的保证,也不是本网站进行的对比基准测试。
同一轮多工具调用
互不依赖的工具调用可在同一轮并行执行,减少模型往返和等待。具有先后依赖的操作仍需顺序执行,例如先读取配置,再根据读取结果修改。
读懂指标
| 指标 | 含义 |
|---|---|
| TTFT | 从发起请求到首个 token 的等待时间 |
| tok/s | 输出生成速率 |
| Token | 模型报告的输入、输出或上下文用量 |
| Cache hit | 服务商报告的缓存命中情况 |
| Cost | 根据已知价格和用量计算的估算值 |
| Coding Plan usage | 支持的服务商返回的计划额度与剩余量 |
公平比较
比较效率时固定模型、任务、上下文、机器与网络,分别记录首次运行和后续运行。单轮的高缓存命中率不能代替完整任务的时间与费用测量。
适用于 1.0.0 RC1。示例数字为演示数据。反馈问题 ↗