演示和生产之间
现在每个人都在谈论零售业的人工智能助手。该演示中,聊天机器人“理解人类语言”并选择商品,在会议上赢得了掌声。但是,一个壮观的演示与一个每天处理数百万个请求、不会在黑色星期五销售额下降并带来可衡量的效益的系统之间存在着巨大的距离。
我们目前正在为一家大型联邦零售商构建这样的系统。这不是膝盖上的飞行员,而是一个工业人工智能平台:一个智能助手,可以帮助买家找到产品、下订单和跟踪订单、退货并获取建议——所有这些都通过正常的对话进行,就像与现场卖家一样。在本文中,我们将同时从两个方面分析该项目:最终客户和业务实际收到什么 - 以及如何在内部安排它在生产中工作。最后,我们将向您展示如何计算此类解决方案的经济性,以免为该模型支付过高的费用。
买家得到什么?
让我们从一切开始的原因开始——利益。助理能够理解用普通语言表达的请求,并且不会强迫人们猜测“正确”的措辞。
买家可以写“可处理高达 80,000 个图形的笔记本电脑”、“带自动卡布奇诺咖啡机的咖啡机”或“三星打折产品”,然后收到一份包含价格、照片和其所在城市的可用状态的合适产品列表。如果所需型号没有库存,机器人会建议类似产品。对于任何产品,他都会提供完整的描述和特点,当被问到“Galaxy A54与A55有何不同,哪个更适合摄影”时,他会建立一个比较表并给出合理的推荐。
接下来是聊天中的整个交易。 “重复我的上一个订单” - 机器人会找到之前购买的商品,检查库存情况,提供缺失商品的替换品并下新订单。在确认之前,他总是说出结果:“订单包含 3 件商品,价值 45,780 ₽。运送到莫斯科 - 390 ₽。总计 46,170 ₽。我们要安排吗?”然后 - 跟踪(“我的订单在哪里”、“什么时候到达”、“更改地址”)、处理付款和退货,无需致电支持:买家给出原因,机器人按产品的日期和类别检查退货的可能性,确认并创建请求。
一个单独的层面是磋商。 “这个过滤器适合我的咖啡机吗?”、“如何获得保修维修?”、“哪款笔记本电脑最适合 AutoCAD?”该机器人不是凭空想象来回答这些问题,而是根据制造商的说明、保修和退货政策、常见问题解答和证书——也就是说,根据经过验证的公司文件。它还会记住偏好:它根据购买和浏览历史记录推荐相关商品,并为已购买的设备建议打折配件。
所有这些都 24/7 工作,对简单请求在几秒钟内响应,对复杂请求最多需要几十秒 - 显示进度,如果服务失败,它会诚实地说“我现在无法检查可用性,一分钟后重试”或将其转移给操作员。
为什么这比“搞砸 GPT”更困难
现在是下半场,演示和制作有很大不同。实现此类助手时最常见的错误如下所示:浏览器 → FastAPI → GPT。用户写入,后端保持连接打开,同时模型生成响应 25 秒,而工作人员在这段时间一直很忙。在负载下,该方案会立即崩溃。因此,我们的平台基于几个强大的架构原则。
制定计划的不是模型,而是规则。 工具调用的序列是由基于规则的规划器构建的 - 基于已识别的意图和预定义的规则确定性地构建。 LLM不会即时“调整计划”,因为调整计划实际上是我们不信任模型的商业决策。
完全异步。 系统中没有长HTTP请求。当买家发送消息时,请求会在 20-50 毫秒内完成:客户端立即收到一个 task_id,然后处理进入 RabbitMQ 队列。然后,Celery 工作线程接收它,运行整个 AI 管道,并通过 Redis Pub/Sub 发布进度,并通过服务器发送事件以流的形式到达浏览器。用户可以看到状态(SEARCH_ProductS → RERANK → LLM_GENERATION)并在生成时收到答案,而不是查看旋转的旋转器。这种事件驱动的方法允许您独立扩展 AI 处理、搜索和业务服务:在目录导入期间,您可以在不接触 AI 的情况下筹集 20 个导入工作人员,而在促销期间,您可以添加推荐工作人员。
在内部,系统被划分为独立的环境,每个环境都有自己的职责范围:用户交互环境(Web、Telegram、移动应用程序 - 没有业务逻辑,也没有数据库调用)、AI 环境(理解请求、选择工具、生成响应)、业务逻辑环境(目录、订单、客户、付款、退货、发货)、搜索环境和知识环境。
知识循环:事务结束和 RAG 开始的地方
该平台有意将两种根本不同的信息流分开。交易循环适用于产品、价格、余额、订单和付款 - 它的来源是 PostgreSQL。知识循环适用于 PDF、说明、常见问题解答、手册、证书和退货政策 - 其来源是 RAG(检索增强生成)。
正是这个环境负责“像经验丰富的推销员一样”进行咨询。文档经过单独的索引管道:摄取→解析→分块→嵌入→索引→混合搜索→重新排名。混合搜索 - Elasticsearch 上的全文加上 Qdrant 上的语义,然后通过交叉编码器重新排名。而且,对于信任至关重要,答案始终基于特定来源,而不是基于模型的“幻想”。
这正是在 RESTART 中我们已经用单独的产品解决的问题 - Ragify、企业-RAG,用于搜索和答复公司文档。 Ragify 将法规、知识库和项目材料转化为受控 AI 搜索,并按来源提供答案,支持混合搜索、从 PDF、DOCX、XLSX、Confluence、1C-Bitrix 和 ERP 下载、基于角色的访问模型、查询审核以及本地或私有云中的部署。在零售平台中,知识回路建立在相同的工程基础上:Ragify 在可靠检索和源代码控制方面的发展几乎没有任何变化就转移到了客户端场景。这是产品方法的主要好处 - 不是为每个客户重新组装 RAG,而是带来经过验证的内核。
经济学:如何计算预算而不为模型支付过多费用
这项技术令人印象深刻,但客户提出了另一个问题:它的成本是多少以及何时会得到回报?在这里,诚实地考虑很重要。
让我们从数字的顺序开始。通过外部 API 进行一个流程的 RAG 试点成本约为 1.5-200 万卢布。相同规模的本地安装 - 300万卢布起,这不考虑服务器和操作。接下来是回报的算术,这是发人深省的。假设推荐人每月收到 100 个请求,顾问在每个请求上花费 7 分钟,即每月约 12 小时。按照 2,500 ₽/小时的费率计算,每月可节省约 30,000 ₽。试点成本为 150 万卢布,投资回收期将需要四年多的时间 - 这不适用于一种狭隘的场景。
结论不是“RAG 本身无法收回成本”,而是“你无法为一根细线程运行它”。当同一平台关闭五个可比流程时,年效应达到180万卢布,投资回收期被压缩到10-13个月。人工智能助手的经济依赖于规模和重用——这就是为什么我们为零售商构建一个单一平台,而不是十几个孤立的机器人。
第二个节省杠杆是正确选择模型以降低错误成本。没有必要对所有任务都使用最昂贵的模型。更便宜的型号可以完美涵盖常规、标准问题;当需要比较多个来源并且错误成本很高时,溢价是合理的。在我们的架构中,这是在设计层面内置的:基于规则的规划器提前知道请求的类型,因此您可以将简单的搜索和复杂的多源咨询路由到不同的模型,而无需LLM的“猜测”。
第三个经常被低估的因素是数据准备。长指令需要分解为完整的步骤,保留表格结构,从图片中提取文本并添加元数据(部门、状态、生效日期、所有者)。输入中的垃圾要么是不正确的答案,要么是因为模型英勇地解析了准备不足的文档而付出了过多的代价。
如何发射:飞行员给出答案
该假设应该在受控飞行员身上进行测试。我们建议从 50-100 个真实的工作问题开始(真实的,而不是虚构的),然后根据标准答案检查机器人的答案。该试点项目衡量了明确的指标:来源选择的准确性、文档响应的正确归属百分比、每个请求节省的时间以及处理一个请求的成本。基线还需要提前确定:传入问题的数量、响应时间和过时材料的比例——否则就没有什么可比较的。
已经实施的项目显示了这在实践中所带来的效果。在 RESTART 的一个案例中,开发花了三个月的时间,搜索信息的速度提高了五倍 - 员工在几秒钟而不是几小时内找到了他们需要的东西。实施上限的基准是摩根士丹利设定的:他们的内部助理索引了大约10万份文件,并且被98%以上的财务顾问团队使用。这是一个成熟解决方案的标志——不是一次性的令人惊叹的效果,而是人们在日常工作中实际使用的工具。
它已经发挥作用的地方:不仅是零售业
零售业并不是我们组装此类系统的第一个领域。工程核心是相同的:受控检索、带有源链接的响应以及模型和数据之间的严格层。学科领域、知识来源和监管要求正在发生变化。
- 乌兹别克斯坦排名前 5 的银行的人工智能平台和 RAG 代理 是一个企业人工智能平台,三个知识库位于一个回路中。该项目通过了试点,得到了客户的积极评价,并继续进行支持、开发和复制。
- 基金会脊柱裂 RAG 助理 ——助手帮助家属、患者、医生和基金员工快速找到经过验证的信息,减轻初级咨询支持的负担。
零售助理、银行环境和医疗基金涵盖不同的任务,但依赖于相同的经过验证的核心 - 与我们作为产品开发的相同核心 Ragify。正是这个核心的重用,使得此类项目的经济性趋于一致。
结果如何?
零售业的人工智能助手不是“GPT之上的聊天机器人”,而是一个分布式生产系统,其中模型仅负责语言,严格的工程负责数据、金钱和可靠性:基于事件的架构、MCP作为业务逻辑的单一合约、具有来源答案的混合RAG和深思熟虑的规模经济。正是这种组合——为买家带来的明显好处加上背后的工业可靠性——将一个壮观的演示变成了一个可以收回成本的系统。
如果您正在为您的业务尝试类似的场景,请从针对实际问题的小型而诚实的试点开始 - 我们将帮助您构建一个可扩展的平台。
RESTART 是一家技术集团,帮助大公司应对复杂的技术变革:人工智能和数据、企业平台、网络安全和集成。 了解有关 Ragify 的更多信息 →
让我们讨论一下您的环境
描述任务、当前系统、约束和预期结果。我们将提供实用的第一步:诊断、试点、审计、路线图或项目团队。
