前阵子一位做招聘的朋友拿了个网名过来,说面试前想了解一下候选人的公开信息,结果搜出来的都是同名账号,越查越乱。我花了十五分钟,从那条招聘平台动态顺藤摸瓜,找到了技术分享社区的发言、代码托管平台上的个人主页,最后连对方参加行业活动的公开照片都翻了出来。朋友惊讶地问我,“你用的什么黑客工具?”我说真没有,全部都是公开的信息,只是把它们按逻辑拼了起来。这件事其实就是开源情报获取(OSINT)里最典型的一种任务:用公开信息,把一段模糊的线索拼成一份可验证的画像。
这篇文章我准备从自己日常做信息分析的实际经验出发,聊聊OSINT到底在做什么、怎么搭工作台、怎么跑完一个完整任务、怎么把搜索练成肌肉记忆,以及哪些边界绝对不能碰。适合风控、安全运营、媒体核查、招聘背调、投资尽调这些岗位的朋友,也适合纯粹对“信息如何变成情报”好奇的人。里面的案例和数据都做了脱敏处理,只保留方法论。
1. 先定义清楚:开源情报到底在“挖”什么
1.1 公开信息不等于情报
很多人觉得OSINT就是“Google一下”“百度一下”,其实差别很大。搜索引擎给你的是信息,而情报是把这些信息加工成可以辅助决策的结论。OSINT的英文全称是Open Source Intelligence,核心词落在Intelligence上,Source只说明信息来自公开渠道。同样的公开资料,普通人看到的是零散内容,分析师看到的是时间线、关联网络和缺口。
我通常用一句话解释这个转化过程:情报就是回答“所以呢”的那一步。你查到了一个人的毕业院校,这是信息;你判断他大概率在哪个城市发展过,这是情报。你找到了一个域名,这是信息;你结合注册时间和业务特征推断其背后公司的运营节奏,这是情报。把这句话记在心里,整个OSINT的检索思路都会不一样。
1.2 三个最常见误解
第一个误解,是“OSINT就是人肉搜索”。这个说法非常不准确。人肉搜索往往没有边界、没有目的正当性,而OSINT强调在合法来源、合法用途的框架下做信息拼图。搜索只是收集环节,甄别真伪、交叉验证、评估置信度,才是情报工作的重头。
第二个误解,是“OSINT是黑客专属”。我在实际工作中服务的场景跨度很大:媒体记者用来核查照片真伪,HR用来做候选人背景核实,律师团队用来做尽调辅助,品牌方用来发现钓鱼仿冒页面。黑客技术反而不是重点,重点是你的信息组织能力和判断能力。
第三个误解,是“工具越高级越厉害”。恰恰相反,新手最容易掉进“工具囤积症”的坑。装了无数工具,却连一条搜索语法都用不利索。工具把部分流程自动化了,但它替代不了“下一步查什么”的判断。这个判断从哪里来?从对信息结构和业务场景的理解里来。
1.3 谁在靠OSINT创造价值
我整理了一下最常见的应用场景,你可以对照看看自己属于哪一类:
| 应用场景 | 具体问题 | 典型产出 |
|---|---|---|
| 招聘背景核实 | 候选人的简历经历是否可信 | 一致性比对报告 |
| 商业尽调 | 合作方的资信与负面记录 | 风险清单 |
| 媒体事实核查 | 图片、引用、事件是否属实 | 溯源结论 |
| 品牌保护 | 是否有仿冒官网和钓鱼页面 | 仿冒线索汇总 |
| 安全运营 | 钓鱼邮件里的域名是否有猫腻 | 判定依据 |
| 研究咨询 | 行业专家与趋势信号 | 人物关系图谱 |
我经常和朋友说,OSINT不是一门“挖密码”的技术,它是一门“拼拼图”的思维方式。当你把视角切换成拼图,看到一条新闻就不会只看热闹,而是会去想:这句话是谁说的、原始信源在哪、还有哪些公开信息能佐证或推翻它。
2. 搭建情报工作台:信息源分层与工具分工
2.1 信息源分层:先回答“从哪找”
很多新手开工第一步就是打开搜索引擎,这是低效的。我建议先给信息源分层,按优先级建立自己的“弹药库”。我常用的分层模型是这样的:
- 第一层:搜索引擎与新闻站点,用来快速定位线索,建立初始关键词集合;
- 第二层:社交平台与内容社区,用来寻找人与事件的蛛丝马迹;
- 第三层:公开档案与数据库,比如企业信用公示、工商登记、版权登记等;
- 第四层:域名、证书、网页历史等技术侧公开数据,用来还原网络资产的时间痕迹。
每一层解决不同的问题。搜索引擎帮你确认“有什么”,社交平台帮你确认“是谁”,公开档案帮你确认“是不是真的”,技术侧数据帮你确认“背后关联着什么”。开工前先问自己:当前最缺的是哪一层的信息?然后直接去那层找,而不是漫无目的地刷搜索页。
2.2 网络侧四件套:Whois、DNS、证书透明日志、网页快照
如果你要做风险调查或者品牌保护,网络侧信息是绕不开的。我把它精简成“四件套”,都是用公开协议或服务就能拿到的数据,不涉及任何扫描和攻击行为。
第一件是Whois,查询域名注册人、注册时间、联系方式。很多老企业会用公司名称或固定邮箱注册域名,这是识别归属的好入口。
第二件是DNS记录。看一个域名的解析目标、邮件服务商(MX记录),能判断其网站托管在哪、邮件服务用的哪家。这些信息在排查仿冒邮件时特别有用。
第三件是证书透明日志。主流CA会把签发的SSL证书写进公开日志,通过日志站点可以反查一个域名申请过哪些证书、是否存在拼写近似的仿冒域名。这个思路比单纯看主域名要深一层,能发现很多“长得像”的真实证书记录。
第四件是网页历史快照。它帮我解决“曾经有什么”的问题。很多时候关键信息在网页改版前、删帖前,历史快照能把这些片段捡回来。
这里要说清楚,上述动作都是在查公开的注册、记录和快照,不是去扫漏洞、不是去连别人服务器。边界把握好了,这些工具才是助力。
2.3 人物侧四件套:用户名、头像、邮箱、图片元数据
做人物相关的分析时,我习惯按四个维度收口:用户名、头像、邮箱、图片元数据。
用户名是最高频的锚点。大多数人在不同平台会复用同一个昵称,所以拿到一个用户名,先用批量检查工具看它在哪些平台有注册足迹,再针对有足迹的平台逐个深挖。这一步能快速勾勒出“网上的他”分布在哪些角落。
头像则是第二个锚点。把不同平台的头像下载下来做反向检索,能发现同一个头像是否被改过名、挪到其他账号上。但要注意,头像撞图也可能是网民随手用了同一个网络素材,不能当成铁证,只能作为“待验证线索”。
邮箱是职业身份的放大器。企业邮箱的格式往往有规律,比如“名.姓”加公司域名,这个规律经常出现在商务邮件、文档页脚、开源软件提交记录里。拿到一个邮箱后,不要急着发信,先用“邮箱+公司域名”“邮箱+GitHub”之类组合去搜,很多公开痕迹会自己浮出来。
图片元数据(EXIF)是最后一个工具,但它经常被人误解。事实上主流社交平台在用户上传图片时会自动剥离EXIF信息,所以想靠下载别人头像拿到拍摄位置,基本是白日梦。EXIF真正实用的场景有两个:一是分析自己或本机构发布的原始文件,看是否泄露敏感信息;二是媒体核查时,通过原始照片或文档的元数据来验证拍摄时间和设备。
2.4 聚合工具与自动化框架,用还是不用
现在市面上有很多漂亮的聚合工具,比如把实体关系画成图的Maltego,又比如开源情报框架项目。我的建议是:新手先不要碰。
原因很简单,聚合工具把你喂给它的数据画成了一张大网,看起来很厉害,但如果你不理解每条边为什么存在,很容易被“看起来相关”误导。我的习惯是先用搜索引擎和手工逻辑把靶心定位好,再用自动化工具做批量扩展。换句话说,工具是放大器,而不是起搏器。你心里先有一个情报假设,才谈得上用工具去验证它。
如果用,也建议从小工具用起。比如想批量收集某个域名相关的公开信息,可以用theHarvester这样命令行小工具查一下它关联的邮箱和子域名。关键是结果出来之后,我会把每一条都人工看一眼,确认它的来源和可信度,而不是直接把输出当结论。
3. 完整跑一遍流程:从单条线索到结构化画像
3.1 出发:一条招聘动态带来的锚点
为了说清楚流程,我构造了一个脱敏案例。假设某次任务里,我们看到一个昵称为“闪闪的咸鱼”的用户,在某招聘平台发了一条动态,文案大意是:从某高校理科专业毕业后,在一家做餐饮SaaS的小公司做数据运营,欢迎大家交流。
信息很少,但已经够用了。我管这种能够锁定身份边界的初始信息叫“锚点”。这里有几个锚点:昵称、毕业院校大类、行业、岗位。好的开局不是急着搜所有内容,而是先把锚点拆出来,列成关键词清单。
3.2 扩散:把锚点转成可检索的关键词集合
接下来要做的,是把每个锚点变成一个检索式。
第一轮,先搜精确昵称。用双引号把“闪闪的咸鱼”包起来,看哪些平台出现过。假设发现一个代码托管平台的同名账号,个人简介写的是“饮食行业数据爱好者”,最近更新了一个关于销售额预测的Python仓库,这明显与餐饮SaaS身份吻合。
第二轮,查这个账号的提交记录。公开仓库的提交记录里往往留着作者信息,假设我们看到提交人邮箱是“jin.wind@example.com”(example保留域名,纯虚构)。这个邮箱就成了下一个锚点。
第三轮,用邮箱关联业务身份。搜索“jin.wind”加“餐饮SaaS”的组合,发现某家公司官网的活动页里出现过同一个名字,职位恰好是数据运营。到这里,招聘动态、代码仓库、公司页面三个信息源形成了闭环。
第四轮,补背景细节。回到毕业院校信息,用“学校+专业+消费数据”这类组合搜校园论坛和公开的学科竞赛名单,找到一个同名同专业的学生记录,从而把教育背景也串了起来。
这四轮走下来,看起来简单,但每一步背后都是筛选。第二轮的提交记录可能几百条,我只看邮箱字段;第三轮的搜索结果可能几十页,我只关注与餐饮SaaS相关的页面。任何情报任务,本质都是在一个大池子里做减法。
3.3 交叉验证:避免“巧合式结论”
这一节是整个流程里最容易翻车的地方。很多人在第二步找到了相似姓名就开始下结论,这是大忌。
我给自己定了一条规则:每条结论至少要有两个互相独立的来源背书,才能标为“中高置信度”。比如“闪闪的咸鱼”在代码平台上写了餐饮数据爱好,这只能说明兴趣;招聘动态说明行业;官网自己晒出的岗位信息说明职业。三个来源彼此独立,结论才站得住。
光有规则还不够,还要区分证据等级。我的分级方式是这样的:
| 置信度 | 判定条件 | 举例 |
|---|---|---|
| 高 | 两个以上独立来源直接指向同一事实 | 招聘动态与官网团队页均显示同一岗位 |
| 中 | 单一来源为主,另一个来源只是间接佐证 | 代码仓库里的邮箱与官网页邮箱同名不同页 |
| 低 | 仅有一个来源,或来源与目标之间靠推断 | 只凭一个相似昵称猜测是同一人 |
低置信度的信息不是不能用,而是要标注清楚“此条为推断,待验证”。情报报告最怕的不是信息少,而是把猜测写得像事实。
3.4 输出报告:情报成稿的结构
最后一步是写报告。我很反对把一堆截图丢给需求方,那不叫情报,叫资料收集。一份能用的OSINT报告,我习惯按这个结构组织:
- 结论摘要。开门见山说清楚你判断“是或不是”“可信或不可信”,每条结论后带置信度;
- 关键证据链。列出来源名称、获取时间、原文地址,让别人能复核;
- 信息缺口。明确列出哪些关键点还没查到,不要让读者误以为报告覆盖了一切;
- 风险提示。哪些信息涉及第三方隐私,哪些信息在引用时要脱敏。
报告的长短不重要,可追溯性才重要。我在实际工作中发现,需求方最反感的并不是“你查到了很少”,而是“你什么都没解释就扔给我一张大表”。所以每次成稿,我都会倒回去检查:如果读者顺着我的来源点下去,能不能得出和我一样的结论?如果不能,说明链路没写透。
4. 检索语法与题库训练:把搜索能力练成肌肉记忆
4.1 搜索引擎运算符组合实战
搜索能力是OSINT的地基,没有捷径,只能靠练。我总结了一套日常最高频的运算符,适用于主流搜索引擎(百度和Bing的语法大同小异,差异我会在下面标注)。
"关键词":精确匹配。查昵称、查工号、查邮箱时必用;site:域名:限定在某个网站内搜索,比如看某个官方域名下有多少页面暴露过邮箱(示例:site:canyin.example.com "jin.wind");filetype:pdf:限定文件类型。很多机构会把名单、年报、会议资料藏在PDF里,用这个语法挖档案很有用;intitle:与inurl::前者限定标题,后者限定链接特征。适合找某事件的专题页;-关键词:排除词。我在查人时会同时排除掉最容易混淆的同名影视明星,让结果快速收窄;*:通配符,适合补全不确定的占位词。
举个例子,如果我想查“闪闪的咸鱼”在技术社区的发言记录,我会这样组合:"闪闪的咸鱼" site:技术社区域名。如果找到了一个邮箱,我下一步会做排除:"jin.wind@example.com" -site:github.com,意思是把已知的代码平台结果去掉,看这个邮箱还在什么意想不到的地方出现过。
这里尤其要提醒:每个运算符都要带着目的去用,不要为了炫技而组合。你问自己的核心问题是“我接下来需要排除什么、限定什么”,语法只是回答手段。
4.2 针对社交媒体的定向搜索技巧
社交平台是一个特殊的信源,因为传统搜索引擎对站内内容的收录往往滞后又不全。我的方法是“两条腿走路”:平台内筛一遍,然后用site:语法在外部引擎补一遍。
平台内搜索优先用好地点筛选、时间筛选,以及“公开”视角。比如查一个人的发言记录时,可以筛选他常提到的城市,检索范围立刻小一半。再比如看某事件的时间线,用since:2023-01-01 until:2023-03-01这类限定时间段的语法(多数主流引擎支持),把搜索窗口锁死。
社交平台的另一个特点是“公共页面比你想的多”。很多行业交流群的简介、活动报名页、公开的参会者列表都会挂在网上,这些都会成为情报源头。在合规范围内,把这些公开页面翻出来,往往比盯着个人主页更有突破性。
我更建议大家养成一个习惯:每次搜索时记录“平台内搜索结果”和“外部引擎的site:结果”有没有不一致。不一致本身就是一个信号,说明平台外还有平行内容值得挖。
4.3 osint题库怎么练最有效
最近“osint题库”这个热词频繁出现,我猜是因为越来越多初学者想知道怎么练、练什么。我自己练过之后,把常见题型划成了几类:
| 题型 | 考察能力 | 常见输入 |
|---|---|---|
| 地理定位题 | 视觉线索、地理常识、建筑与植被识别 | 一张街景或室内照片 |
| 身份串联题 | 跨平台信息归并、命名习惯 | 昵称、邮箱、头像 |
| 事件时间线重建 | 时间逻辑、公共记录检索 | 航班、新闻稿、活动照片 |
| 文档溯源题 | 元数据阅读、文本特征分析 | PDF、办公文档、图片 |
| 组织归属题 | 资产与公开信息关联 | 域名、官网、新闻通稿 |
练习时我给自己定了几条规则:
第一,限时。每道题给自己30到60分钟,不许超过。时间压力会逼你建立“先信息、后判断”的节奏,而不是在一个线索上死磕。
第二,写操作日志。每做一个操作就记一条:“当时想验证什么假设、去查了哪个来源、结果如何”。做完题之后看日志,你会惊讶地发现自己绕了多少弯路。
第三,复盘“失败的岔路”。大多数人只复盘正确答案,我建议也复盘错路。有一次我在地理定位题里被一个“看似东南亚”的街景骗了三十分钟,最后才发现是欧洲某葡语城市。复盘后发现,我漏看了一个关键的路牌文字细节。这类失败经验,价值远高于做对五道简单题。
第四,看题解要学“顺序”而不是“答案”。别人先查什么、为什么先查那个,比最终答案重要得多。把顺序抽出来,变成你下一题的行动预案。
至于去哪里找题目,国内外安全竞赛社区里几乎每次都会设OSINT方向的题目,很多平台还开放历史题库;行业培训课程里也会有配套练习。我的建议是先从单点题开始,比如“只做身份串联题”,做熟了再混合题,混合题能训练你在多种信源之间切换的节奏。
4.4 把复盘变成习惯
这里讲一个我练成肌肉记忆的细节:我会按周维护一张“检索语法-适用场景”对照清单。每碰到一个有效组合,就记到清单里;每发现一个无效组合,也记下来。比如我长期记录后发现,搜索中文社交平台上某类行业黑话时,直接搜索的平台内结果精度远高于外部引擎,所以这类场景我会优先处理平台内搜索,而不是先套site:语法。
通过反复练习和复盘,最后要做到的不是背下多少条语法,而是拿到任何一道题,能在五秒内想清楚“第一查什么、第二排除什么”。这个手感,只能靠题量喂出来。
5. 必须刻在脑子里的边界:合规红线与自我防护
5.1 “公开可得”不等于“可以随意使用”
聊OSINT不聊边界,就是耍流氓。我见过太多新手学到一点搜索技巧就想“炫技”,最后惹出麻烦。有一点必须先想明白:信息公开可获取,和法律允许你以此种目的使用它,是两码事。
在做任何分析之前,我都会先问自己三个问题:第一,这个任务的目的正当吗?是为了招聘核实、商业风险判断、新闻报道核实,还是为了骚扰、报复、窥探?第二,我打算接触的信息,是否涉及与任务无关的第三方?第三,我的结论会被谁使用、用来做什么决策?任何一个问题答不清楚,都应该立刻收手。
尤其是在处理个人信息时,要遵守最小必要原则。你能查到一个人的全部公开痕迹,不等于你要查完。只取跟任务直接相关的那部分,查完即止,不扩散、不留存,这条底线决定了这个行业能不能体面地做下去。
5.2 来源合法性自检清单
我在带新人时会给一份自检清单,每条都过一遍才能把信息写进报告:
- 信息是当事人或所在机构自愿公开的吗?
- 获取过程中,有没有绕过任何访问控制、付费墙或登录限制?
- 涉及的人与任务是否直接相关?是否包含未成年人或无关人员?
- 使用范围是否超出任务方授权?
- 输出结果会不会对当事人或第三方造成明显伤害?
如果五条里有一条不满足,我就宁可不写,也不会为了“报告好看”硬凑。外人可能觉得这是保守,但真正处理过纠纷的人都知道,情报分析翻车,十次有九次不是出在技术环节,而是出在来源模糊和目的失焦上。
5.3 保护自己:留痕、脱敏、分级
最后说几点自我保护的操作习惯。老话说“先保护好自己,才能保护好数据”,在情报工作里一点不假。
取证要留痕。我保存证据时不只是截图,而是把来源页面、访问时间、URL地址一起记录。必要时保存网页快照文件,防止对方删帖后线索消失。这个习惯在很多关键节点救过我。
讨论要脱敏。在群里、会议里分享案例时,把昵称、邮箱、公司名称都改成脱敏代号。我见过有人为了图省事,直接把原始截图发到内部分享群,结果被转发出去,惹出很大的麻烦。脱敏不是麻烦,而是职业素养。
结论要分级。每次汇报都明确标注高/中/低置信度,不让需求方把“猜测”和“实锤”混为一谈。我做报告时还有一个小习惯:把“已验证”和“待验证”分成两个区块,让结论的硬度一眼可见。对方事后复盘时,也会更清楚该信什么、该补什么。
我记得早年间带新人复盘过一个问题:两个人拿到了完全一样的搜索结果,一个得出了正确结论,一个被假线索带偏。差在哪里?差在对信息源性质的理解。前者先问“这个平台发布的信息有没有审核机制”,后者直接照单全收。这个判断力,才是OSINT真正考验人的地方。
我现在接到任何分析需求,第一件事不是打开搜索引擎,而是先写下三条边界:我想解决什么问题、哪些信息我绝对不碰、结论交给谁。把这三件事想清楚之后再动手,你会发现搜索的速度和准度反而都会大幅提升。至于那些眼花缭乱的工具和语法,都只是这条主线上的晚礼服,真正撑场面的,永远是你的判断力。