Towards Scalable and Interpretable Mobile App Risk Analysis via Large Language Models
2026/10/12 7:28:44
网站建设
项目流程
文章核心内容、创新点总结及关键部分翻译
一、文章主要内容总结
本文针对移动应用商店人工审核流程繁琐、现有自动化工具灵活性差且难以处理多源异构数据等问题,提出了基于大型语言模型(LLMs)的移动应用风险分析系统Mars,旨在实现可扩展、可解释的自动化风险识别与分析。
1. 研究背景与问题
- 移动应用商店每日接收大量应用提交,其中部分存在广告弹窗、恶意软件、应用变形等安全风险,但当前审核依赖人工与半自动化工具,存在效率低、成本高、易出错的问题。
- 现有自动化工具多针对单一风险类型,数据来源单一,难以处理高维异构数据;直接应用LLMs则面临上下文窗口限制(无法处理多源数据)与幻觉问题(输出不实信息,导致误判)。
2. Mars系统设计
Mars采用“离线知识准备+在线实时分析”两阶段流程:
- 离线阶段:构建风险识别树(Risk Identification Tree),整合两类关键信息——基于历史下架应用数据的“数据驱动信号”(如同类风险应用的共性模式)和领域专家提炼的“知识驱动规则”(如异常分发行为)。该树为层级结构,根节点对应风险类别(如广告弹窗),叶节点为风险相关特征,可过滤无关数据,降低LLM输入维度。
- 在线阶段:新应用提交后,先通过风险识别树筛选无关特征,再将提取的关键指标输入LLM进行风险判定;