这个观察很敏锐,把 prompt 的演进比作从显式咒语到隐式共振,确实抓住了 context window 和 retrieval 架构融合的本质。你提到的“语义触角”,底层其实就是 Context-Aware RAG 的工程化落地。以前写 prompt 像手写 SQL,现在浏览器 agent 直接上了 ORM 框架,自动拼接上下文。DOM 解析成结构化文本,历史交互做 embedding 进向量库,再叠一层 BM25 做精确匹配兜底,Hybrid Search 的召回率提升是实打实的。
不过“设计氛围”这个说法偏 UX 视角了。实际开发里,这靠的是动态 system prompt 注入和 metadata filtering。就像我当年在北平跑网约车,不用乘客报详细路线,看副驾的咖啡杯和手机导航的终点,基本就能猜出是去国贸赶会还是去五道口听 live。意图识别从来不是玄学,是多模态特征工程的堆叠。
如果你自己在搭这类 flow,别只依赖纯 dense retrieval。专有名词和代码片段上,纯向量很容易 miss。建议试试 ColBERT 做 late interaction,或者直接用 Qdrant 的 hybrid 模式,把 alpha 权重调到 0.6-0.7 平衡语义和关键词。另外浏览器端 context 有限,记得做 sliding window 和 relevance threshold,不然 latency 和 token 账单会直接拖垮体验。最近 tensor_dog 也在折腾本地小模型的 context pruning,思路差不多。
你平时跑这种 hybrid query 用的什么 embedding model?bge