Architect发布Liquid Inference:将金融撮合机制引入大语言模型推理市场
2026年10月,Architect Financial Technologies正式推出Liquid Inference大模型推理实时拍卖平台并在Product Hunt上线。该产品将现代金融交易所的双向竞价与限价机制引入AI推理市场,让各类算力供应商对每次Prompt进行动态竞价,帮助开发者在无需重构代码的情况下获取最低边际成本的算力服务。
核心要点
- 金融级竞价撮合:Liquid Inference将受监管衍生品交易的市场结构原则引入大模型推理,支持实时订单簿、交易前限价与确定性清算结算。
- 逐请求动态拍卖:平台支持供应商针对每一次Prompt请求开展动态竞争,自动将任务派发给满足约束且报价最低的算力节点。
- 全生态工具兼容:全面兼容OpenAI与Anthropic标准API,原生适配Cursor、Claude Code、Cline等主流智能体与代码生成工作流。
- 细粒度采购规则:买方可在请求中定义单次任务费用上限、首字延迟(TTFT)、最低吞吐量要求以及零数据保留策略。
详细分析
交易所模式落地:打破AI推理静态定价壁垒
随着企业在生成式AI领域的投入激增,模型推理费用正迅速成长为技术预算中占比最高的基础设施开支之一。然而,目前市场上绝大多数大模型接口仍沿用静态标价和双边采购合同,定价机制缺乏弹性。由Brett Harrison创立的Architect推出的Liquid Inference,核心目标是通过借鉴现代金融交易所的双向价格发现机制,将Token推理转变为具备高流动性的数字大宗商品。
在Liquid Inference的架构中,平台维护着一个面向AI推理的实时订单簿系统。不同基础设施服务商与算力中心可以实时提交针对具体开源或闭源模型的卖方报价。买方发送请求时,撮合引擎会在毫秒级时间内执行智能拍卖,并在首个Token生成前锁定最高结算价格,确保成本不会超出调用方预期。
灵活约束与路由:兼顾性能指标与合规底线
除单纯的价格竞争外,AI企业级生产环境通常对服务等级协议(SLA)与数据安全有着严苛要求。Liquid Inference支持买方在每个任务上附加精细的采购规则,包括最高首字延迟(Time to First Token)、最低Token吞吐速度、合规地理区域限制以及零数据保留(Zero Data Retention)要求。
系统内置的Auto智能路由算法能够根据任务上下文与实时订单深度,在数百个可用模型之间自动筛选性价比最优的落地方案。更为重要的是,开发者无需对现有软件栈进行破坏性改造——平台直接兼容OpenAI及Anthropic的标准SDK,可无缝嵌入Cursor、Claude Code、OpenCode等开发者日常依赖的智能编程助手。调用完成后,系统为每笔任务提供透明的结算凭证,记录中标服务商、限价上限及竞价深度,为企业财务分析提供可追溯依据。
算力资产化演进:盘活长尾与闲置GPU产能
对于算力基础设施提供商而言,服务器负载波动造成的算力闲置长期存在。Liquid Inference为全球具备GPU算力的机构提供了一个中立的变现通道。供应商可以根据机房电费、闲置利用率等动态指标灵活下发边际报价,在非高峰时段通过极具竞争力的价格吸引流量,实现算力资源的动态利用。这一机制使得算力供给从重资产买断逐步过渡为更具弹性、按需结算的现货交易市场。
行业影响
Liquid Inference的上线标志着AI基础设施服务正加速向金融化与大宗商品化演进。长期以来,算力分发依赖于云巨头的中心化集成分配,而实时拍卖机制的引入为中小型云厂商与独立算力中心提供了以价格和性能为唯一考核标准的公平竞争场域。对于开发者与初创企业,高透明度与激烈的节点竞争将直接推动单位Token成本的结构性下行,降低智能体应用的运营门槛。同时,前置限价与确定性收据的设立,也为AI企业解决不可控的账单膨胀问题提供了切实可行的工程与风控示范。
常见问题
Liquid Inference与传统的LLM聚合路由工具有何区别?
传统的LLM聚合服务通常基于静态官方标价或预设权重进行负载均衡,计费标准固定。Liquid Inference则引入了交易所级别的双向实时拍卖与订单簿机制,让不同的后端供应商直接竞争单次Prompt的处理权,从而动态发现市场最低边际成本并提供不可篡改的事后对账单。
开发者接入该平台是否需要修改现有代码?
不需要。Liquid Inference完全兼容OpenAI和Anthropic的API通信协议,支持官方SDK以及Cursor、Cline、Claude Code等所有主流AI编程工具,开发者仅需更换API端点和密钥即可无缝迁移。
实时竞价过程是否会显著增加大模型调用的端到端延迟?
系统在微秒/毫秒级完成订单簿检索与撮合匹配,并且支持买方设定严格的首次输出响应时间(TTFT)上限。如果特定供应商无法在指定时间阈值内响应,拍卖规则将自动剔除该节点,确保整体服务性能不受影响。


