
4B开源模型检索性能媲美GPT-5.6 Sol,成本降低百倍:Castform与Neon联合方案解析
2026年8月5日,Castform与Neon联合发布研究成果,展示了一个经过Castform后训练的4B参数开源模型在搜索结果检索准确性上已达到GPT-5.6 Sol的水平。该方案结合了Neon的Lakebase Postgres搜索扩展与Castform的强化学习(RL)后训练技术,解决了多轮代理检索中GPT-5.6 Sol成本高(约0.03美元/次)且延迟大(>10秒)的痛点,实现了100倍的成本缩减,标志着代理检索进入高效低成本时代。
核心要点
- 性能突破:一个仅4B参数的开源模型经过Castform后训练后,在检索准确度上成功追平了GPT-5.6 Sol。
- 成本优势:相比使用闭源旗舰模型,该方案的运行成本降低了100倍。
- 技术协同:Neon的Lakebase Postgres提供高效的数据检索基础设施,而Castform通过RL后训练提升了模型的决策规划能力。
- 模式转变:检索技术已从2022年的单次RAG(检索增强生成)演进为2025年后的多轮代理检索(Agentic Retrieval)。
详细分析
检索模式的演进:从RAG到代理检索
回顾AI检索的发展历程,2022年左右行业普遍采用嵌入向量搜索(Embedding Search),pgvector等插件成为开发者为LLM提供上下文的核心工具,这本质上是手写的RAG管道。然而,到了2025年,AI代理(Agents)开始占据主流。开发者开始构建多跳(Multi-hop)搜索工作流,将复杂问题分解为多个子任务。检索模式已从单次搜索系统转向代理检索,模型需要在循环中多次规划和搜索。这种模式下,每一次循环迭代都意味着对旗舰模型的一次调用,导致GPT-5.6 Sol等模型的端到端延迟超过10秒,单次请求成本高达约0.03美元,难以在大规模场景下普及。
Castform与Neon的技术协同效应
为了解决高性能检索的成本瓶颈,Castform与Neon提出了联合方案。一个优秀的AI代理需要具备两个核心能力:一是上下文获取(Context),即找到正确数据的工具;二是模型决策(Model),即决定搜索什么内容。Neon通过其Lakebase Postgres及全新的搜索扩展解决了第一个问题,使数据库中的原始数据变得可用且易于搜索。Castform则解决了第二个问题,通过对4B参数的小型开源模型进行强化学习(RL)后训练,弥补了小模型原生能力的不足,使其在处理复杂的代理检索任务时能够表现出与顶级闭源模型相当的水平。
行业影响
该新闻展示了AI行业的一个重要趋势:特定任务的性能不再完全依赖于模型规模。通过针对性的后训练(如RL)和优化的基础设施(如Lakebase Postgres),参数量较小的开源模型可以在特定领域(如检索和数据操作)中替代昂贵的旗舰模型。这不仅大幅降低了企业构建AI应用的门槛,还推动了从昂贵的闭源API向更具性价比、更灵活的开源+私有数据方案的转型,预示着高效代理检索技术将进入大规模商业化阶段。
常见问题
问题 1:为什么GPT-5.6 Sol在多轮检索中面临挑战?
GPT-5.6 Sol本身性能强大,但在多轮代理检索中,由于需要频繁循环调用,其高昂的API成本(约0.03美元/次)和显著的延迟(>10秒)成为了实际应用的阻碍。对于需要大规模扩展的业务来说,这种成本结构是不可持续的。
问题 2:4B小模型是如何在检索准确性上追平大模型的?
这主要归功于Castform提供的强化学习(RL)后训练技术。通过针对检索场景的特定优化,4B模型学会了如何更有效地进行搜索规划和决策,从而在特定任务上弥补了其与巨型模型之间的基础能力差距。
问题 3:Neon在这一方案中起到了什么作用?
Neon通过其Lakebase Postgres和搜索扩展提供了关键的基础设施支持。它解决了如何让AI代理能够廉价、大规模地读取、搜索和修改数据库中原始数据的问题,为模型提供了高质量的上下文环境。


