出海技术挑战——Lalamove端云协同审核实战揭秘
作者:Lalamove Tech / Driver & DS
背景:当国际化遇上“审核瓶颈”
核心架构:为什么我们需要“端云协同”?
分层治理:端侧保障数据质量,云端聚焦决策分析,协同加速案例流转
端侧(Mobile):做好“守门员”。 利用端侧轻量级模型,实时拦截低质量、不合规的图片(如模糊、无人脸、证件残缺),从源头保障数据质量,减少无效上传。 云端(Cloud):充当“大脑”。 聚焦复杂决策,利用大模型(LLM)和高精度 CV 模型处理非结构化信息,解决“长尾”难题。
应用场景与成效分析
场景一:人脸比对审核
业务背景
解决方案 - 人脸比对技术的应用
人脸检测 & 特征提取: 提取高维人脸特征向量(embedding)并判断是否为真实人脸 身份比对: 与司机注册时留存的人脸照片进行 1:1 比对,计算相似度分数(Similarity Score) 阈值判定 高于通过阈值 → 认证成功 低于拒绝阈值 → 认证失败
成效与收益
场景二:司机注册证件审核
业务背景
错误证件类型 占比最高 证件照片不符合规范 占被拒绝照片比例的第二
解决方案 - 前端视觉引导和OCR结合大语言模型的应用
对证件版式和字段顺序高度敏感,一旦证件样式变化就需要新增或调整规则 多语言、多国家场景下规则数量快速膨胀,维护成本随业务扩展线性上升 OCR 产生轻微错字或字段缺失时,正则匹配容易整体失效 难以处理语义层面的判断,例如证件类型混用或字段语义不明确 对复杂、长尾场景的覆盖能力有限,人工兜底比例较高
成效与收益
场景三:海外市场车辆月度审核
业务背景:当“人工肉眼”遇上“复杂规则”
标准执行难统一(Subjectivity): 在Lalamove,车辆的月度审核规则多达数十余项、执行难度高、标准难完全统一。 拒单理由过于集中: 在被拒绝的申请中,我们发现了一个惊人的数据:约四成的照片是因为“车牌展示不完整”而被拒绝请中,我们发现了一个惊人的数据:约四成的照片是因为“车牌展示不完整”而被拒绝。 这意味着,超过三分之一的失败并非因为车辆本身,而是因为司机没拍好车牌。这是一个典型的、可以通过端侧引导来解决的“非技术性错误”。
解决方案 -- 前端视觉引导和后端多模态大模型检测分层治理
客户端:自研轻量级模型,把 AI 装进手机里
后端:多模态大模型驱动复杂决策
核心难点:当规则多到“令人发指”
探索之路:从“幻觉”到“落地”
❌ 版本一(暴力拆解): 针对数十余项标准,分别调用大模型。 结果: 效果尚可,但 Token 消耗巨大,成本和耗时都无法接受。 ❌ 版本二(一锅端): 把所有规则写进一个超长 Prompt,一次性问完。 结果: 模型“顾此失彼”,注意力分散,导致幻觉严重,准确率暴跌。 ✅ 版本三(分组+结构化):最终方案 策略:基于相关性分组。我们将审核标准分为“内容相关”、“车辆相关”、“车贴外观相关”等分组,分步骤提取信息。
破局关键:只提取,不决策
LLM 负责看: 输出结构化 JSON(例如:"text_visible": true, "side_view": true)。 代码负责判: 业务系统根据 JSON 字段进行逻辑判断。 这既避免了大模型的逻辑幻觉,又保留了业务规则的灵活性。
工程化落地:细节决定成败
安全前置: 在与信息安全部门深度协作后,我们设计了严格的数据脱敏清洗机制。 合规调用: 在调用大模型前,所有敏感信息(如具体的车牌号文字、背景人脸等)均在端侧或中间层完成脱敏。大模型只负责识别“车贴样式”等非敏感视觉特征。 这一方案完美平衡了成本优势与数据合规的双重需求。