金融信贷这个行业,表面上看是资金生意,骨子里其实是风险生意。我在消费金融和银行零售信贷条线摸爬滚打这些年,见过太多团队在"审批效率"和"不良率"之间反复横跳——放宽一点,坏账飙升;收紧一点,获客成本压不住。最近半年我把不少精力放在用华为云智果 AgentArts 搭建金融信贷 AI 智能体上,从贷前资料核验到贷中风险预警再到贷后催收话术生成,跑通了几条完整的链路。这篇就把我踩过的坑、验证过的配置、以及那些文档里不会写的经验,一次性摊开讲清楚。
1. 为什么金融信贷场景值得单独搭一个智能体
1.1 信贷业务链条里,哪些环节最"吃"智能体
先说结论:不是所有信贷环节都适合上智能体。我见过有团队一上来就想做一个"全能信贷助手",结果做出来的东西四不像,业务方用两天就扔了。真正值得投入的,是那些高频、规则密集、但又需要一定语义理解的环节。
贷前阶段,最典型的是资料核验与反欺诈初筛。客户提交的身份证、银行流水、收入证明、征信报告,格式五花八门,有的是扫描件,有的是手机拍照,还有的是PDF加密文件。传统OCR只能做字段提取,但"这张流水单的进账是否呈现工资特征""这份收入证明的公章位置是否异常"这类判断,需要智能体结合规则库做推理。
贷中阶段,风险预警和额度调整建议是重头戏。一个客户今天突然在三个平台同时申请贷款,或者他的还款账户余额连续三天低于月供,这些信号单独看都不致命,但组合起来就是风险前兆。智能体在这里的价值是把分散的信号聚合成可解释的风险提示,而不是简单抛一个分数给风控经理。
贷后阶段,催收话术生成和还款意愿识别是我实测下来ROI最高的场景。不同逾期天数、不同客户画像,话术策略完全不同。M1阶段的客户可能只是忘了,一句提醒就够;M3以上的客户需要施压,但措辞必须合规,不能踩红线。智能体可以根据客户历史交互记录,动态生成既有效又合规的话术。
1.2 华为云智果 AgentArts 在这个场景里的定位
AgentArts 本质上是一个智能体编排平台,它把大模型的推理能力、工具调用能力、知识库检索能力封装成可配置的组件。对金融信贷场景来说,它解决的核心问题是:让业务人员能参与智能体的调优,而不是所有改动都排队等研发。
我举个实际例子。风控策略里有一条规则是"近三个月查询次数超过6次且无放款记录,标记为高风险"。这条规则以前写在代码里,改一次要走完整的发版流程。用 AgentArts 之后,我把这条规则做成知识库里的一个条目,风控经理自己就能在后台调整阈值,智能体实时生效。这个变化看起来小,但在业务节奏快的信贷公司,意味着策略迭代周期从两周缩短到半天。
另一个关键点是 AgentArts 的工作流编排能力。信贷审批不是单轮对话,而是一个多步骤的决策链:先核验身份,再查征信,再跑反欺诈规则,最后综合评分。AgentArts 允许我把这些步骤串成可视化的工作流,每个节点可以独立配置模型、提示词和工具,出了问题能快速定位是哪个环节的偏差。
1.3 一个必须先想清楚的问题:智能体替谁做决定
这是我在项目启动会上一定会问业务方的问题。金融信贷是强监管领域,智能体可以辅助决策,但不能替代决策,至少现阶段不行。我的做法是把智能体的输出定位为"建议+依据",最终审批权保留在人工手里。
具体到配置上,我会在智能体的系统提示词里明确写:你是一个信贷风险辅助分析助手,你的输出是分析建议,不构成最终审批结论。所有涉及拒绝、降额、冻结的建议,必须附带至少三条可追溯的数据依据。这个约束看起来是合规要求,实际上也提升了业务方对智能体的信任度——他们能看到"为什么",而不是一个黑盒结论。
2. 用 AgentArts 搭建信贷智能体的核心配置拆解
2.1 知识库的切分策略:别把制度文件整篇塞进去
我见过最常见的错误,就是把公司的信贷政策制度PDF直接上传到知识库,然后指望智能体自己找到相关条款。实测下来,这样做的检索准确率惨不忍睹。原因很简单:一份制度文件动辄几十页,切分粒度太粗,检索出来的片段往往包含大量无关信息,模型容易被干扰。
我的做法是按"决策点"切分。比如《个人消费贷款审批细则》里关于收入认定的部分,我会拆成独立条目:"工资收入认定标准""奖金收入认定标准""经营收入认定标准""收入证明异常情形"。每个条目控制在300到500字,包含具体的数值阈值和例外情况。
切分的时候有个技巧:在每条知识的前面加上"适用场景"标签。比如"适用场景:客户提供银行流水但无代发工资标记时使用"。这个标签会参与向量检索,能显著提升召回的相关性。我实测过,加了场景标签之后,知识库检索的准确率从大概六成提升到八成五以上。
另外,信贷政策经常更新,知识库的版本管理必须做好。AgentArts 支持知识库的多版本管理,我的习惯是每次政策调整后新建一个版本,保留旧版本至少一个季度。这样万一新版本出了问题,能快速回滚,也方便对比新旧策略的差异。
2.2 工具调用的编排:哪些能力必须外挂
大模型本身的能力有限,信贷场景需要的很多能力必须通过工具调用实现。我在项目里配置了这几类工具:
第一类是征信查询接口。这个不用多说,智能体需要根据客户授权去拉取征信报告,然后解析关键字段。这里要注意的是接口的幂等性设计,避免重复查询导致征信记录被多次硬查询。
第二类是规则引擎。有些硬性规则不适合让模型判断,比如"年龄必须在22到55岁之间""当前逾期天数超过90天直接拒绝"。这些规则我封装成独立的规则引擎工具,智能体调用后直接返回布尔结果,不经过模型推理。这样做的好处是确定性高、可审计,监管检查的时候能清楚说明每条拒绝理由的来源。
第三类是计算工具。信贷审批涉及大量计算:负债收入比、月供收入比、综合评分。这些计算必须精确,不能让模型"心算"。我把计算公式封装成工具,模型只负责提取参数和调用,计算结果由代码保证。
第四类是话术模板库。贷后催收场景用得多,不同逾期阶段、不同客户类型对应不同话术模板。智能体根据客户画像选择模板,再根据具体情境做微调。
这里有个坑要提醒:工具调用的超时设置很关键。征信接口有时候响应慢,如果超时设置太短,智能体会反复重试,既浪费资源又可能触发接口限流。我的经验是把征信查询的超时设到15秒,同时配置最多两次重试,重试间隔3秒。
2.3 提示词工程:把风控逻辑翻译成模型能懂的话
提示词是智能体的灵魂,信贷场景的提示词尤其讲究。我的提示词结构一般分四层:
第一层是角色定义。不要只写"你是一个信贷助手",要写清楚具体职责边界。比如:"你是一名消费信贷贷前审核辅助分析员,负责根据客户提交的资料和征信数据,识别潜在风险点并给出审核建议。你不做最终审批决定,你的输出仅供人工审核参考。"
第二层是分析框架。把风控经理的思考逻辑显性化。我会写:"分析时请按以下顺序进行:第一步,核验身份信息一致性;第二步,评估收入稳定性;第三步,检查负债水平;第四步,识别异常申请行为;第五步,综合给出风险等级建议。"
第三层是输出格式约束。信贷场景要求输出结构化,方便后续系统处理。我会指定JSON格式,包含风险等级、风险点列表、建议措施、依据来源等字段。
第四层是合规红线。明确写出不能做的事:"不得基于性别、地域、民族等非相关因素给出差异化建议""不得使用歧视性语言""所有拒绝建议必须附带具体数据依据"。
实测下来,这四层结构能把智能体输出的可用率从不到五成提升到八成以上。特别是分析框架那一层,相当于把资深风控经理的思维过程教给了模型,效果立竿见影。
2.4 多轮对话的状态管理:信贷审批不是一问一答
信贷审批流程往往需要多轮交互。客户可能先提交了部分资料,审核员追问后再补充;或者智能体发现某个疑点,需要审核员确认后再继续。AgentArts 的会话管理能力在这里很重要。
我的配置是每个申请单对应一个独立的会话上下文,会话里维护几个关键状态:已收集资料清单、待确认疑点列表、当前审批阶段、历史交互记录。这样即使用户中途离开,下次回来还能接着上次的进度继续。
有个细节值得注意:会话上下文的长度要控制。信贷审批可能涉及几十轮交互,如果把所有历史都塞进上下文,token消耗会很大,而且模型容易被早期信息干扰。我的做法是只保留最近五轮完整对话,更早的交互压缩成摘要形式保留关键结论。
3. 贷前资料核验智能体的完整落地过程
3.1 从一份银行流水说起:智能体到底要看什么
银行流水是贷前审核的核心材料,但很多人不知道的是,同样一份流水,不同审核员关注的点差异很大。我访谈过十几个资深审核员,把他们的关注点归纳成几类:
- 收入真实性:进账是否呈现规律性?是否有明确的"工资""代发"标记?进账方是否与客户声称的雇主一致?
- 流水稳定性:近六个月月均进账是多少?波动幅度多大?有没有突然的大额进账?
- 负债痕迹:是否有固定的还款扣款记录?扣款金额和频率是否暗示了其他贷款?
- 异常信号:是否有当天进当天出的"过桥"资金?是否有与客户身份不符的大额交易?
这些关注点就是智能体提示词里"分析框架"的来源。我把它们写成具体的检查项,让模型逐项分析并给出结论。
3.2 资料解析的工程细节:OCR之后还有大量工作
AgentArts 本身不直接做OCR,但可以调用OCR工具。我的流程是:客户上传资料后,先调用OCR提取文本和版面信息,然后把OCR结果连同原始图片一起交给智能体分析。
这里有个关键细节:OCR结果必须保留置信度信息。有些字段OCR识别置信度低,比如手写签名、模糊的公章,这些地方智能体要特别标注出来提醒人工复核。我在提示词里明确写:"对于OCR置信度低于0.8的字段,请在输出中标注'需人工复核'。"
另一个细节是多页资料的关联。一份完整的银行流水可能十几页,OCR是逐页处理的,但智能体需要跨页关联信息。我的做法是在OCR结果里保留页码和版面坐标,提示词里告诉模型"同一笔交易的借贷信息可能分布在相邻页面,请结合上下文判断"。
实测中我还发现,不同银行的流水格式差异极大。有的银行流水是表格形式,OCR效果好;有的是文本流形式,OCR容易串行。针对这个问题,我在知识库里维护了一份"各银行流水格式特征"的文档,智能体分析前先识别银行类型,再选择对应的解析策略。
3.3 反欺诈规则的智能体化改造
传统反欺诈靠规则引擎,但规则引擎的问题是只能处理结构化信号,对非结构化信息无能为力。比如"客户提供的收入证明公章模糊"这种信号,规则引擎处理不了,但智能体可以。
我把反欺诈规则分成两类:硬规则和软规则。硬规则仍然走规则引擎,比如"身份证号与姓名不匹配直接拒绝"。软规则交给智能体,比如"收入证明的公章位置偏移超过正常范围,建议人工复核"。
软规则的提示词写法很讲究。不能写得太绝对,否则误报率高;也不能太模糊,否则没有指导意义。我的写法是给出具体的判断标准和置信度分级。比如:"如果公章边缘模糊但整体轮廓可辨,标记为低风险疑点;如果公章完全无法辨认或明显为PS痕迹,标记为高风险疑点。"
这里分享一个实测数据:纯规则引擎的反欺诈误报率大概在15%左右,加入智能体软规则分析后,误报率降到8%以下,同时漏报率没有明显上升。这个提升主要来自智能体对非结构化信号的识别能力。
3.4 人工复核环节的交互设计
智能体的输出最终要交给人工复核,这个交互界面的设计直接影响使用体验。我的经验是:智能体的输出要"可追溯、可操作、可反馈"。
可追溯是指每个风险点都要能点开看到原始依据。比如智能体说"流水显示近三个月有两笔当天进当天出的资金",审核员点击后应该直接跳转到流水对应位置,高亮显示那两笔交易。
可操作是指智能体给出的建议要具体。不要只说"建议进一步核实收入",要说"建议要求客户补充近六个月个税缴纳记录,或提供劳动合同"。
可反馈是指审核员能对智能体的判断做标注。这个反馈数据非常宝贵,是后续优化提示词和知识库的依据。我在系统里加了一个简单的"采纳/不采纳/部分采纳"按钮,每周统计一次,针对不采纳率高的场景做专项优化。
4. 贷中风险预警与贷后催收的智能体实践
4.1 贷中预警:从"事后发现"到"事前提示"
贷中风险预警的核心挑战是信号稀疏且分散。一个客户可能今天改了一次手机号,明天换了一张还款卡,后天在另一个平台申请了贷款。这些信号单独看都不严重,但组合起来就是风险前兆。
我用 AgentArts 搭了一个预警智能体,它的工作流程是:每天定时拉取客户的各类信号(还款行为、账户变动、外部查询记录等),然后让智能体做综合分析,输出风险等级和预警理由。
提示词里我特别强调了一点:"不要孤立地看待每个信号,要分析信号之间的关联性。"比如客户同时出现"还款账户余额下降"和"新增外部查询记录",这两个信号叠加的风险等级应该高于单独出现。
预警智能体的输出我设置了三个等级:绿色(正常)、黄色(关注)、红色(预警)。黄色和红色会推送给对应的客户经理,绿色只记录不推送。这个分级机制很重要,否则客户经理每天收到几百条预警,很快就会忽略。
实测下来,预警智能体的准确率大概在七成左右,也就是说十条红色预警里有七条确实是风险客户。这个准确率不算完美,但比纯规则引擎的五成准确率已经好很多。而且智能体的预警理由更详细,客户经理能快速判断是否需要介入。
4.2 催收话术生成:合规与效果的平衡
催收话术是智能体在信贷场景里最"出彩"的应用,也是最容易踩坑的地方。踩坑的点在于:模型很容易生成过度施压的话术,触碰合规红线。
我的做法是在提示词里设置硬性约束:"禁止使用威胁、恐吓、侮辱性语言""禁止提及客户家人、朋友、同事""禁止暗示将采取法律手段以外的强制措施""所有话术必须包含明确的还款指引"。
同时,我维护了一个合规话术模板库,智能体生成的话术必须与模板库的风格一致。如果模型生成的话术与模板库差异过大,系统会自动拦截并提示重新生成。
效果方面,我做过一个对比测试:同一批逾期客户,一半用人工话术,一半用智能体生成的话术。结果智能体话术的还款转化率比人工话术高约12个百分点。分析原因,主要是智能体话术更"个性化"——它会根据客户的历史交互记录调整措辞,比如对之前态度好的客户用温和提醒,对多次失联的客户用更正式的通知口吻。
4.3 还款意愿识别:从对话中提取信号
还款意愿识别是催收场景的进阶应用。客户在对话中的措辞、语气、承诺具体程度,都暗示了还款意愿。智能体可以实时分析这些信号,给催收员提示。
我配置的识别维度包括:客户是否主动询问还款方式(高意愿)、是否承诺具体还款日期(中高意愿)、是否只说"知道了"但不给具体时间(中意愿)、是否直接挂断或辱骂(低意愿)。
这些信号会实时显示在催收员的工作界面上,帮助催收员调整策略。比如识别到高意愿客户,催收员就重点提供还款便利;识别到低意愿客户,催收员就准备升级处理流程。
这里有个伦理边界要注意:还款意愿识别不能用于歧视性对待。我在系统里明确禁止将识别结果用于"决定是否采取过激催收手段",只用于"调整沟通策略"。
5. 实测中踩过的坑与优化经验
5.1 模型幻觉在信贷场景的致命性
大模型的幻觉问题在信贷场景是致命的。我遇到过智能体"编造"征信记录的情况——客户征信报告里明明没有某笔贷款,智能体却在分析里提到了。这种错误如果没被发现,可能导致错误的审批结论。
我的应对措施有三层:第一层是关键数据强制引用来源。提示词里要求智能体在提到任何具体数据时,必须标注数据来源(如"征信报告第2页第3段")。第二层是交叉验证。对于智能体提取的关键字段,系统会自动与OCR原始结果比对,不一致时触发人工复核。第三层是定期审计。每周随机抽取一定比例的智能体输出做人工复核,统计幻觉率。
实测下来,这三层措施能把幻觉导致的实际错误率控制在千分之一以下。但要注意,完全消除幻觉目前不现实,关键是建立发现和纠正机制。
5.2 知识库更新滞后导致的策略偏差
信贷政策更新频繁,知识库如果更新不及时,智能体会给出过时的建议。我踩过一次坑:公司调整了某类客户的收入认定标准,但知识库没同步更新,智能体连续三天按旧标准审核,导致一批本该通过的客户被拒。
后来我建立了一个知识库变更管理流程:政策调整后,由政策制定部门在系统里提交变更申请,风控和合规部门会签,然后由我这边更新知识库并做回归测试。整个流程控制在24小时内完成。
另外,我在智能体的输出里加了一个"策略版本号"字段,每次知识库更新后版本号递增。这样如果发现某批审批有问题,能快速定位是哪个版本的知识库导致的。
5.3 工具调用失败的降级策略
工具调用失败是常态,征信接口超时、规则引擎报错、计算服务不可用,这些都会发生。关键是失败后的降级策略要明确。
我的配置是:征信查询失败时,智能体不继续分析,直接输出"征信数据获取失败,请人工处理"。规则引擎失败时,智能体跳过规则判断,但标注"规则校验未完成"。计算工具失败时,智能体给出计算所需的参数,由人工完成计算。
降级策略的核心原则是:宁可少做,不可做错。信贷场景里,一个错误的自动结论比没有结论更危险。
5.4 业务人员的接受度曲线
技术团队容易忽略的一点是:智能体最终是给业务人员用的,他们的接受度决定了项目成败。我观察到的接受度曲线大概分三个阶段:
第一阶段是好奇期,业务人员愿意试用,但期望值可能过高,以为智能体能解决所有问题。这个阶段要主动管理预期,明确智能体的能力边界。
第二阶段是质疑期,试用一段时间后遇到误报或漏报,业务人员开始不信任。这个阶段要快速响应反馈,针对高频问题做优化,用实际改进重建信任。
第三阶段是融合期,业务人员逐渐摸清智能体的脾气,知道什么场景该信、什么场景该自己判断。这个阶段要建立常态化的反馈机制,让优化持续进行。
我的经验是,整个曲线走完大概需要两到三个月。期间最重要的是快速响应,业务人员提的问题如果一周内没有反馈,信任度会急剧下降。
6. 关于智能体在信贷场景的边界思考
6.1 哪些决策永远不该交给智能体
做了这么多项目,我越来越清楚一件事:智能体在信贷场景的价值是放大优秀审核员的能力,而不是替代他们。有几类决策我坚持不交给智能体:
第一类是涉及重大金额的审批。比如单笔超过一定额度的贷款,必须人工审批。智能体可以做前期分析,但最终决定必须由人做。
第二类是涉及特殊客群的审批。比如老年客户、残障客户、特殊职业客户,这些客群的风险特征复杂,智能体的训练数据可能不足,容易产生偏差。
第三类是涉及政策模糊地带的审批。政策不可能覆盖所有情况,遇到模糊地带,需要人的判断和担当,智能体给不出这种判断。
6.2 可解释性不是可选项,是必选项
金融监管对可解释性的要求越来越高。智能体的每个输出,都必须能回答"为什么"。我在项目里坚持几个原则:
每个风险点必须关联具体数据。不能只说"综合评分低",要说"综合评分低,主要因为近三个月查询次数6次(超过阈值5次)、当前负债收入比65%(超过阈值60%)"。
每个建议必须关联具体规则。不能只说"建议拒绝",要说"建议拒绝,依据《个人消费贷款审批细则》第3.2条关于查询次数的规定"。
每个结论必须可复现。同样的输入,智能体应该给出同样的输出。我通过固定随机种子、记录完整提示词和工具调用日志来实现这一点。
6.3 人机协作的最佳比例
最后分享一个我一直在思考的问题:人机协作的最佳比例是多少?我的观察是,智能体处理70%到80%的常规案例,人工处理20%到30%的复杂案例,这个比例下效率和质量的平衡最好。
低于这个比例,智能体的价值没充分发挥;高于这个比例,人工复核的压力太大,容易流于形式。当然这个比例因机构而异,风控能力强的机构可以适当提高智能体处理比例,风控能力弱的机构应该降低。
我在实际项目里会持续监控几个指标:智能体自动通过率、人工复核推翻率、不良率变化。这三个指标结合起来看,能判断当前的人机比例是否合适。如果自动通过率高但不良率上升,说明智能体太激进;如果人工推翻率高,说明智能体的判断标准与人工差异太大,需要校准。
这套东西我还在持续迭代,信贷场景的智能体应用远没有到成熟阶段。但有一点我越来越确信:智能体的价值不在于它多聪明,而在于它多稳定、多可解释、多可管理。在金融这个容错率极低的行业,稳定和可控比聪明重要得多。