《ORQA: An Occupation-Realistic Question and Answer Framework for LLM Professional Knowledge》提出了一种名为ORQA的新框架,用于评估大语言模型在职业层面的专业知识。其核心目标是弥补现有基准测试的不足——现有测试要么只评估抽象能力,要么依赖昂贵且难以扩展的专家评估,无法系统性地衡量模型对具体职业的实际帮助。
以下是该研究的主要内容概括:
1. 研究动机与问题
随着LLM成为通用工作工具,仅评估抽象能力已不够,需要了解模型在具体职业中的实用性。
现有劳动力市场研究多关注AI的暴露度或生产率影响,而非模型间的职业能力比较;现有基准多偏向数字/计算机类工作,或依赖专家编写任务(如GDPval),难以大规模扩展。
因此,需要一种可扩展、覆盖广泛职业、可溯源的职业知识评估方法。
2. ORQA框架的构建方法
职业选择:基于BLS和O*NET数据,按工资总额分配条目,覆盖SOC全部21个主要组。
权威来源发现:为每个职业建立可信来源白名单(如监管机构、许可机构、专业协会、政府网站),排除研究论文和低质量来源。
证据卡提取:从文档中提取连续句子作为来源引用,并关联任务和职业。
问题生成:将证据卡转化为六选项多项选择题(必含“以上全部”和“以上都不是”),正确答案必须由来源逐字蕴含,干扰项来自同一文档。
自动化质量过滤:包括来源蕴含、问题合理性、干扰项合理性、唯一正确答案、长度一致性、难度预测试(三个小模型并行测试)、可消除性检查等。
人工验证:两名标注员检查条目质量,人工与自动化“良好”判定一致率约67%。
最终题库:480个问题,来自187个来源主机,覆盖116个职业和全部21个SOC主要组。
3. 评估实验
测试模型:15个前沿和开放权重模型(如GPT-5.4、Claude Opus 4.6、Gemini 3.1 Pro、Llama 3.3 70B等)。
测试方式:
闭卷多项选择(每题3个随机种子);
开放式回答(三人评审团评分);
按工资总额加权的聚合评分。
主要结果:
总体表现:前沿模型Claude Opus 4.6(62.4%)、GPT-5.4(60.3%)、Claude Sonnet 4.6(58.7%)领先;开放模型33-41%;所有模型均高于随机猜测(16.7%),但即使最优模型也答错超三分之一。
职业异质性:不同职业表现差异巨大。医疗健康从业者达78-80%,而安装维修仅44-46%,办公行政支持仅36-43%。个别职业如精算师、钣金工、渔猎巡护员,前沿模型得分为0%。
跨模型差异:某些职业上模型间差异可达100个百分点(如财务经理)。
开放式与加权:开放式分数略低但排名稳定;工资加权不影响总体结论。
网络搜索:有网络搜索的模型表现显著提升(多项选择78-80%,开放式71-73%)。
4. 验证与外部信号
与GDPval(Spearman ρ=+0.90)和GDPval-AA Elo(ρ=+0.92)高度相关。
覆盖Anthropic经济指数中高暴露和低暴露职业,表明不矛盾于外部经济信号。
预训练污染诊断:14/15模型在截止日期后来源上表现等于或优于截止日期前,表明记忆不是主要因素。
5. 主要贡献
可扩展系统:从权威数据自动创建职业级知识资源。
ORQA资源:480题、116职业、21 SOC组的基准数据集。
十五模型实验:闭卷与开放式评估,揭示模型、职业和SOC组间的显著差异。
外部验证:与GDPval、GDPval-AA和Anthropic经济指数比较,并探索社区线程版本(Reddit)扩展。
6. 局限与讨论
ORQA评估的是可溯源的职业知识(报告责任、阈值、程序等),而非整体职业能力。
覆盖广泛但不均衡,部分职业条目少,组级结果应谨慎解读。
权威来源可能不完整,正确答案应视为与特定来源一致,而非专业决策正确。
存在预训练记忆风险,但初步诊断不支持。
建议与人在回路、任务型、交互式评估结合使用。
ORQA提供了一种低成本、可扩展、可溯源的职业级评估方法,能够补充任务型和专家型评估,为未来更真实的职业AI评估奠定基础。这里是自己的论文阅读记录,感兴趣的话可以参考一下,如果需要阅读原文的话可以看这里,如下所示:
项目地址在这里,如下所示:
摘要
我们提出ORQA,一种用于测试大语言模型职业层面知识的方法。既有方法要么通过任务定义将抽象的大语言模型技能映射到职业,要么利用难以大规模获取且成本高昂的专家知识。ORQA通过将O*NET职业与可信的职业专属网站(如监管机构、许可机构、专业组织及政府出版物)相连接,并将其转换为可溯源的问题-答案对,从而对上述两类方法形成补充。自动化流程与人工审核相结合,产出了一组关于职业的高质量问题。通过本方法创建的问题集覆盖了SOC全部21个主要组中的116个职业,包含来自187个不同网站的480个问题。每个问题都旨在探查与该职业相关的真实世界技能问题。我们通过该方法测试了15个前沿模型和开放权重模型。Claude Opus 4.6、GPT-5.4和Claude Sonnet 4.6表现最佳,约为58-62%;而较小的开放权重模型则达到约33-41%的性能。不同职业之间的表现差异显著。医疗健康相关职业表现最高(78%),而办公与行政支持类职业约为40%。在个别职业上(如钣金工和渔猎巡护员),表现基本为零。我们还发现,开放式问题和按工资总额加权并不会显著影响模型在该基准上的排名。我们认为,利用现有的可信职业专属信息来测试大语言模型在专业领域的知识,可能是一种可扩展且有用的方法,用于在未来评估职业层面的AI表现。结果和数据可在orqabench.org获取。
1 引言
基准测试一直是衡量和引导人工智能进步的核心。对于语言模型而言,MMLU、BIG-bench、HELM、GPQA、ARC和SWE-bench等基准使得以可复现的方式比较系统在推理、知识、编程和问题解决方面的能力成为可能[Hendrycks et al., 2021, BIG-bench authors, 2023, Liang et al., 2023, Rein et al., 2024, Chollet, 2019, Jimenez et al., 2024]。然而,随着语言模型成为通用工作工具,评估问题发生了变化。我们不再仅仅想知道模型是否具备某种抽象能力。我们想了解其在整个经济中的实际影响。我们想知道它是否能帮助某个特定职业的从业者回答实践中出现的那类问题,以及某个模型对该职业是否比另一个模型更有用。现有工作尚未以可扩展的方式提供这种覆盖整个美国经济、跨模型的职业层面模型基准。现有经济学研究衡量的是AI在劳动力市场中的暴露度、采用率或生产率效应[Brynjolfsson et al., 2018, Eloundou et al., 2023, Handa et al., 2025, Chatterji et al., 2025, Brynjolfsson et al., 2025, Dell'Acqua et al., 2026]。一些关于AI在劳动力市场中应用的论文对于考察AI对劳动力市场的影响很有价值。然而,这些通常不是AI系统的性能比较基准。相反,这些论文通常估计某个特定AI系统对劳动力市场的总体影响,而不是比较一个系统对特定工作的有用性与另一个系统对相同工作的有用性。
近期的一些基准开始瞄准更真实的任务。这些包括网页智能体任务[Zhou et al., 2023]、企业工作流[Drouin et al., 2024]、 consequential工作场所任务[Xu et al., 2025]以及软件工程任务[Jimenez et al., 2024]。这些是有前景的发展。然而,这些基准相对于劳动力市场而言仍然相当有限。许多基准目前考察的是计算机中介的数字工作。此外,近期将智能体基准与职业对齐的尝试发现,基准中存在对数学和计算机相关职业的强烈偏向[Wang et al., 2025, 2026]。GDPval代表了一项重要的近期努力,旨在考察更具经济相关性的任务。然而,GDPval使用专家编写的提示以及专家或模型评估,这限制了其扩展到数百个职业的能力[Patwardhan et al., 2025]。也有一些尝试通过专家评估AI在任务层面的表现来弥合这一差距[Shao et al., 2025]。因此,差距似乎在于基准测试。我们需要职业层面的评估,它应(a)可扩展,(b)广泛适用于整个经济,以及(c)能够评估职业层面的知识。我们还希望保留当前系统的一些积极方面,包括来源可验证性和模型比较,同时超越纯粹的任务完成,涵盖专业知识。
图1:ORQA从职业抽样到验证基准问题的构建流程。
我们引入职业相关问答(Occupation Related Question and Answer,ORQA)来满足这一需求,同时探索自动创建根植于经济的职业层面基准的可行性,并比较这种方法与专家创建基准的优缺点。ORQA的创建源于这样一种认识:许多职业存在权威文本,其中包含与该职业专业人士相关的专业知识。专业人士预期运用的实践知识存在于职业专属文件中,包括政府机构、监管机构、许可机构、学术来源、标准组织以及正式和非正式专业协会。这也反映了关于职业通过其创造专业规范并将其编纂为正式和非正式来源的社会学理解[Abbott, 2014]。我们相信,此类文件可用于提供可扩展的职业层面比较,只要它们能够与O*NET职业相连接并转化为可溯源的问题。我们也清楚ORQA的范围。具体而言,ORQA处理的是职业知识中可溯源的部分(报告责任、专业建议、阈值、程序和指南),而非整体职业能力。此外,ORQA设计用于在存在权威信息的若干职业上运行,而非覆盖整个劳动力市场。相反,我们将ORQA视为一个系统,它展示了自动化、可溯源、职业层面比较的可行性,并补充了任务型和专家型方法。
我们提出一个智能体系统,用于大规模创建职业相关问答对。我们从BLS和ONET的职业信息开始[U.S. Bureau of Labor Statistics, 2024, National Center for ONET Development, 2026],创建职业专属的权威来源列表。利用这些列表,我们检索与职业相关的文档。然后我们从源文档中创建证据卡。这些卡片作为自动化系统验证信息的标准。我们在证据卡上测试模型的开放式答案,并使用相同来源材料测试多项选择题。随后我们通过一系列自动化过滤器确保问题的质量和正确性。我们还加入了人工评估步骤,由两名标注员根据质量标准手动检查条目、其来源和答案选项的质量。我们的人工与自动化“良好”判定之间的一致性约为67%。我们将此作为衡量可扩展自动化过滤器相对于专家策展性能的指标。正确性被定义为与源文档中精确蕴含的关系。所有选中的条目也须符合相同的人工确定标准。我们创建了一个经过策展的权威ORQA数据集,包含480个问题,来自187个来源主机、116个职业以及SOC全部21个主要组。我们在没有检索或浏览能力的情况下测试了15个前沿模型和开放权重模型。
我们主要测试闭卷多项选择,每个问题使用三个随机种子。我们还测试了一项开放式任务,其中模型只看到问题文本,必须提供简短的自由回答,由三人评审团评分。我们还提供了按工资总额加权的度量,该度量使用基于就业人数乘以平均工资的加权职业。
我们观察到三个主要结果。其一,ORQA在多项选择和开放式任务中都能在一定程度上区分模型。对于闭卷多项选择任务,前沿模型(Claude Opus 4.6、GPT-5.4和Claude Sonnet 4.6)非常接近,分别为62.4%、60.3%和58.7%。Gemini 3.1 Pro为56.2%,o3为51.7%。中档模型(Gemini 2.5 Flash和Claude Haiku 4.5)在47-48%范围内,较小或较旧的模型为33-41%。绝对分数低于通用知识任务,因为这些问题经过人工策展以使其非平凡并经人工验证,因此剩下的是对模型而言真正困难的问题。对于开放式任务,绝对分数再次略低于闭卷多项选择,正如预期。然而前沿排序保持不变:GPT-5.4为54.2%,Claude Opus 4.6为53.1%,Claude Sonnet 4.6为50.6%。工资总额加权不影响总体结论。前沿模型再次位居前列,绝对分数也仅显示出适度差异。
其二,总体分数掩盖了显著的职业与模型交互差异。对于某些职业,许多模型表现良好,而对于另一些职业,即使前沿模型也表现不佳。例如,GPT-5.4总体表现为60.3%,但在精算师、钣金工和渔猎巡护员上表现为0%,在空乘人员上为11%。我们在某些工作中观察到巨大的跨模型差异(高达100个百分点)。对于财务经理,GPT-5.4在所有种子上表现完美,而GPT-3.5 Turbo则无一完美。即使在高层次SOC类别层面,也观察到异质性。对于代表性最强的类别,医疗健康从业者,前沿模型表现约为78-80%,而对于安装、维护和维修,前沿模型仅表现44-46%,对于办公和行政支持工作,前沿模型表现36-43%。这很有用,因为它允许雇主和雇员超越模型的总体表现,转而考察某个模型对某类工作的可靠性。
其三,ORQA观察到一个不同的实体,但也追踪外部可用的信号。ORQA与GDPval(+0.90)和GDPval-AA Elo排名(+0.92)在重叠模型上显示出高相关性(Spearman)。
ORQA还显示出在Anthropic经济指数暴露度分箱中对职业的覆盖。这表明ORQA既覆盖了Anthropic经济指数中频繁暴露的职业,也覆盖了不频繁暴露的职业,并且追踪了外部可用的信号。这意味着ORQA目前似乎不与经济和工作的外部可用信号相矛盾。ORQA还增加了执行来源感知、职业感知和可扩展模型比较的能力。
最后,我们提出四项贡献。我们的第一项贡献是一个可扩展的系统,用于从权威数据创建职业层面知识资源。我们提出了一种通用方法,将公共数据转化为可验证的问题,以及对此任务重要的质量和平衡考量。我们的第二项贡献是将该系统实例化为ORQA,一个包含480个条目的资源,涵盖116个职业、SOC全部21个主要组以及数字和非数字职业。我们的第三项贡献是一项十五模型闭卷多项选择和开放回答实验,通过聚类自举法提供不确定性,并按职业工资总额进行加权聚合。我们观察到模型、职业和SOC主要组之间存在显著差异。我们的第四项贡献是将ORQA与职业相关的外部信号进行比较,如GDPval、GDPval-AA以及Anthropic经济指数的暴露度。我们还展示了如何利用社区线程版本(利用公共讨论数据,例如关于职业的Reddit线程)将职业索引系统扩展到权威数据之外。因此,ORQA既是一种资源,也是一个示例,说明利用特定来源数据的自动化可以在多大程度上扩展到职业层面的理解。
2 相关工作
通用能力指标。通用语言模型基准在追踪编程、科学知识、推理、语言理解及其他领域的进展方面发挥了重要作用[Hendrycks et al., 2021, BIG-bench authors, 2023, Liang et al., 2023, Rein et al., 2024, Chollet, 2019, Jimenez et al., 2024]。虽然这些基准有助于评估能力,但它们不适合评估对工作或经济的影响,因为它们不是围绕职业构建的。例如,在抽象能力基准上得分高并不一定意味着该模型能帮助机械师、场地管理员、会计师、司机或护士处理各自领域中出现的具体问题。
相反,经济学文献中关于AI对就业市场影响的证据侧重于暴露度、使用情况和领域。许多经济学论文考察了暴露度,以识别最易受AI或生成式AI影响的职业或任务[Brynjolfsson et al., 2018, Webb, 2020, Felten et al., 2021, 2023, Eloundou et al., 2023]。近期也有研究考察使用情况[Handa et al., 2025, Appel et al., 2025, Chatterji et al., 2025, ?]。最后,实地研究为特定领域(如知识和客户服务工作)的质量和生产率影响提供了更具体的见解[Brynjolfsson et al., 2025, Dell'Acqua et al., 2026]。
有几种类型的基准与理解AI的经济影响相关。然而,与ORQA不同,这些通常不提供可重复使用的测试,以在相同的职业索引问题上评估多个模型。相反,它们通常评估更现实的企业、智能体或工作任务。例如,近期基准已从抽象技能转向更现实的工作。WebArena、WorkArena、WorkArena++、TheAgentCompany和SWE-bench都针对软件问题、企业流程、 consequential工作场所类任务或智能体或模型的网页任务进行测试[Zhou et al., 2023, Drouin et al., 2024, Boisvert et al., 2024, Xu et al., 2025, Jimenez et al., 2024]。这代表了向更现实评估的转变。尽管如此,这些基准往往侧重于数字、计算机中介的工作。近期将智能体基准与职业连接的努力揭示了基准中对计算机和数学类职业的显著偏向,以及对就业市场部分的严重代表性不足[Wang et al., 2026, 2025]。
知识和经济价值基准。GDPval在性质上与ORQA最为相似。GDPval测试模型在经济上有价值的职业任务上的表现。这些任务由专家创建,并由专家或模型评估[Patwardhan et al., 2025]。GDPval的优点是其现实性。然而,任务由专家创建,这使得反复扩展到数百个职业的成本高昂。另一方面,ORQA通过使用权威职业信息为职业任务创建可验证来源来实现扩展。另一项已开始将AI系统与ONET任务连接的努力强调了人-AI协作和人-AI辅助在模型评估中的重要性,而不仅仅是端到端任务解决[Shao et al., 2024, Chang et al., 2025]。ORQA并不与这一努力相对立,而是评估其中更狭窄和具体的一个方面。ORQA不是衡量端到端任务表现或辅助的价值,而是评估模型的输出是否与某个职业的权威知识库相一致。
3 方法
从探索性到批准的流程
我们分两个阶段创建了当前流程。在第一阶段,我们创建了一个智能体流程,包含多个自动化步骤,从职业数据和可信在线来源中生成大量潜在问答对。这个初始阶段的目标不是创建题库本身,而是深入了解什么构成一个好的职业问题。两名标注员手动检查了这些生成问题的样本。对于每个问题,答案选项、来源和问题都使用相同的质量标准进行评分。标注员随后提供解释,说明为什么某个问答对应被拒绝。一个标注仪表板显示了若干常见的问题类型:答案未由来源充分蕴含、干扰项可以用一般领域知识回答、使用研究文章而非可信来源,以及正确答案被模糊修饰语所掩盖。人工与自动化“良好”标注之间约有67%的一致率。我们将此一致率作为自动化可扩展门控与专家策展之间相似性的指标,但不应将自动化视为专家策展的替代品。正确性本身锚定于来源的逐字蕴含,并独立于此可扩展门控。在下文中,我们描述当前状态的系统。该系统生成的所有条目都经过相同的质量验证步骤过滤。我们不区分早期和后期条目,也不追踪每一步被拒绝的候选数量。从职业抽样到平衡池的整个流程总结于图1。
获取职业
我们从美国劳工统计局职业就业和工资统计的2024年5月全国表开始。对于每个标准职业分类(SOC)代码,我们计算工资总额,即全国总就业人数乘以该职业的平均年薪。这代表了流经该职业的年度劳动报酬总额。然后,我们根据该组占全国工资总额的比例,在SOC主要组之间分配条目。这为广义和狭义职业类别都赋予了经济意义。我们尝试在每个职业类别内按工资总额降序获取职业条目。
每个职业的领域白名单
如果对某个职业进行一般网络搜索,会返回数百万个离题或低质量页面,如内容农场、营销页面或博客。相反,我们将给定职业的来源搜索限制在从O*NET官方来源信息中策展的可信发布者列表内。例如,注册护士可以来自aacn.org(美国重症护理护士协会)、nursingworld.org(美国护士协会)、ncsbn.org(全国州护理委员会理事会)、该州的州护理委员会,以及联邦政府来源bls.gov、osha.gov和cdc.gov。每个职业都有适合该职业的白名单。这些白名单是完整的。任何文档都不能来自不在白名单上的域。不存在任何总体允许列表,使学术或其他文档能够绕过职业专属白名单。
研究论文在来源处过滤,而非在门控处过滤
研究论文不是专业人士需要负责的内容。相反,它报告的是研究结果。因此,任何使用此类来源的条目在我们的评分方案中都会因research_paper_source而失败,且没有资格获得良好评级。此类条目无论质量如何基本上都无用,而且这些来源根本不被流程使用(没有任何职业将学术出版商列入白名单,也不执行任何学术搜索)。在获取之前消除这些来源,而不是在生成后拒绝它们,更安全(从未进入流程的论文不可能在评分者失误中幸存),也更成本有效(不会在必然被拒绝的条目上浪费提取、生成、评分或获取预算)。这种区分是按文档类型而非托管来源进行的。第三方研究通常由权威机构存档。例如,托管在.gov域上的会议论文仍被视为研究论文。
来源发现和获取
发现是通过搜索API进行的单次通用网络轮次,限制在该职业的白名单内,因此每个候选文档都来自管辖该职业的发布者。不从允许列表之外拉取任何内容。
证据卡和内容创建
文档被提取,然后解析为结构化对象。文档以2.5至4千字节的窗口分块,重叠100个token以避免上下文丢失。每个窗口随后通过证据卡提取模型(GPT-4o)。每张卡将从文档中提取一到三个连续句子作为来源引用。该卡还将提取来源引用中引用的任务或程序,以及相应的职业。
条目创建
每张卡被转换为一个六选项多项选择题。正确答案必须由来源引用蕴含,并且可以从来源引用创建。干扰项答案从同一文档内创建。“以上全部”和“以上都不是”保证作为六个答案选项中的两个出现在每个问题中。六个答案选项中只有一个可以是正确的。答案选项还要求长度相似,并且没有明显的提示性答案。如果某个条目在任一标准上失败,则记录该条目并拒绝该卡。
自动化质量和分类
条目创建后,会经过一系列自动化过滤器。其中一些过滤器是为了防止通过人工测试发现的失败模式而创建的。失败的条目会被发送到特定的重新生成尝试,而不是立即拒绝。重新生成尝试产生的条目随后在失败点重新插入流程。检查按以下顺序执行:正确回答完全由原始引用蕴含;问题完整且合理;所有答案选项主题适当且没有明显荒谬;没有两个回答是彼此的释义;基于原始内容只有一个回答正确;回答长度相似且不暗示使用特定来源(例如,“根据NFPA……”);该条目不能由GPT-4o mini、Claude Haiku 4.5和Gemini 2.5 Flash三者在闭卷基础上并行解决(如果可以,则被视为太容易并拒绝);任何答案选项都不能基于一般背景知识被排除(由独立LLM评估);正确答案不会在模糊术语(如“标准”或“适当”)下掩盖,而其他答案引用具体值或工具。最后一个过滤步骤是与人工标注对齐的步骤。正是这一步使流程能够自动达到人工定义的“良好”答案。A.4节显示了确切的提示和每项检查的失败率。
领域再平衡和职业下限再平衡
一旦质量检查成功,就会根据三条领域规则进行领域平衡,以避免任何职业的条目过度集中于单一领域。一条规则确保单一来源的域在该SOC中的条目占比不超过30%。第二条规则允许对职业核心的联邦监管域给予更大比例(40-50%),并将边缘域控制在较小比例(15-20%)。第三条规则屏蔽少量低质量域。最后,执行职业下限再平衡,保留所有至少有一个验证条目的职业,同时限制每个职业的条目数量。这避免了高价值职业(如cdc.gov中的注册护士)主导题库的情况。可用领域(如医疗保健)存在集中趋势。为解决这一问题,我们还对代表性不足的职业进行了重点扩展,每个职业至少三个条目。这将至少包含三个条目的职业数量增加到116个中的106个。
最终题库
最终ORQA题库包含480个条目,分布在116个职业中,涵盖SOC全部21个主要组,来自187个不同来源主机。约43%的条目来自联邦政府来源(以.gov结尾)。其余来自许可组织和专业组织,另有两个条目来自州林业推广服务。osha.gov是最主要的来源主机,占题库的9.8%,远低于每个职业单一来源30%的上限。覆盖范围广泛但不均衡:一些SOC主要组(如生产和医疗健康从业者)有许多职业,而另一些(如农业、渔业和林业)只有一两个职业。我们在第5节回到这个问题。
评估
我们在闭卷测试中评估了15个模型。这意味着模型只看到问题文本和六个答案选项。没有浏览或检索。我们测试了以下模型:GPT-5.4、GPT-5.3-chat-latest、GPT-5.2、o3、GPT-4o、GPT-4o mini、GPT-3.5 Turbo、Claude Opus 4.6、Claude Sonnet 4.6、Claude Haiku 4.5、Gemini 3.1 Pro、Gemini 2.5 Flash、Llama 3.3 70B、DeepSeek V4 Pro和Qwen 2.5 7B。480个问题中的每一个都在每个模型上独立运行三次,使用不同的随机种子。我们报告准确率作为所有问题-模型-种子组合的均值。我们使用聚类自举法估计标准误,其中每个聚类对应一个职业。这是正确的聚类层级,因为同一职业内的条目具有相似内容,不能假设为独立。对于有六个可能答案的多项选择题,随机猜测的准确率为1/6≈16.7%。我们将其作为参考线。
4 结果
条目验证
在解释分数之前,我们考虑ORQA条目在多大程度上具有职业性质。ORQA主张三个效度来源。第一,条目与职业相关联。每个条目都与一个O*NET职业相关联,并源自行业协会、机构、标准组织、许可组织、监管组织、学术机构或其他定义或监督该职业工作性质的组织所制作的材料。第二,回答正确性来源于来源而非模型推断。也就是说,正确回答必须由来源材料中的精确摘录所蕴含。最后,条目在加入题库之前要经过第3节详述的自动化验证,这些验证使用人工标注进行了调整。图1中的兽医示例就是其中一例。OSHA工作场所暴露指南规定了卤化麻醉剂的绝对水平。ORQA将其转化为一个职业条目,正确回答之所以正确,是因为它存在于来源中,而不是因为模型推断了其合理性。
总体表现
同一个480条目题库以三种不同方式评估:闭卷多项选择、模型评分的开放式回答,以及按工资总额加权的闭卷准确率(图2)。这三种视角产生了相似的可比结果。在闭卷多项选择中,Claude Opus 4.6以62.4%位居第一,其次是GPT-5.4为60.3%,然后是Claude Sonnet 4.6为58.7%。三个前沿模型非常接近,彼此相差约4个百分点。接下来是Gemini 3.1 Pro为56.2%,GPT-5.3-chat-latest为54.2%,GPT-5.2为52.8%,o3为51.7%。
图2:ORQA在多项选择、开放式和工资加权评估中的总体表现。
注:所有面板评估相同的职业索引题库和模型集合。每个面板为每个模型绘制两个点(如适用):无工具的闭卷分数,以及十个具有原生网络搜索工具的模型的网络搜索分数,而五个没有网络搜索的模型仅显示闭卷分数。闭卷多项选择和工资加权分数对每个条目平均三个种子,开放式分数使用三人评审团,工资加权仅改变聚合权重。条形显示在职业层面重采样的聚类自举标准误。
中等模型如Gemini 2.5 Flash为47.0%,Claude Haiku 4.5为48.2%,约为一半。GPT-4o为43.5%。开放模型范围从33.9%到40.8%。GPT-3.5 Turbo为33.3%。所有十五个模型都高于16.7%的随机猜测分数,但由于测试题库的性质(仅包含非平凡问题),即使表现最好的模型仍然会答错超过三分之一的职业相关问题。
在开放式输出中,分数降低但前沿排名保持不变。对于开放式输出,每个模型只看到问题文本,没有选项或来源材料。然后模型生成最多五行的自由形式回答。为帮助缓解单一评审对特定模型的偏见,使用了来自不同提供商的三个评审。一个OpenAI GPT评审、一个Claude评审和一个Gemini评审。每个评审获得问题、正确答案和被评估模型的匿名回答。每个模型的最终分数是由三人评审团多数投票决定的二元值。
在该集合中,GPT-5.4以54.2%位居第一,其次是Claude Opus 4.6为53.1%,Claude Sonnet 4.6为50.6%。正如对答案生成与识别相比的预期,分数比多项选择低约7-9个百分点。然而,顺序保持相当相似。能够使用基本网络搜索工具大大提高了两项任务的表现。前沿模型在开放式任务上表现约为71-73%,在多项选择上约为78-80%,这比闭卷测试的惩罚有显著改善。其他五个没有网络搜索工具的模型仅在闭卷模式下评分。排行榜对经济加权也相当稳健。使用每个职业的全国工资总额,Claude Opus 4.6再次以66.8%位居第一,其次是GPT-5.4为64.2%,然后是Claude Sonnet 4.6为63.4%。多项选择、开放式和经济加权之间结果相似,意味着总体排序不是由每个任务的六个选项或未加权职业组合驱动的。
职业异质性
职业之间存在大量异质性,被总体排行榜所掩盖。在SOC主要组层面,总体表现水平和跨广泛职业类别的排名都存在显著差异(图3)。前沿模型在覆盖最全面的组——医疗健康从业者(13个职业,52个条目)上表现78-80%,在安装、维护和维修上表现44-46%,在办公和行政支持上表现36-43%。不过我们要强调,不应过度解读组级结果。当前清单中有许多SOC主要组仅由少数职业覆盖。例如,如表3所示,食品制备和服务仅贡献一个条目,农业、渔业和林业仅一个职业;两者都太稀疏而无法绘制,并从热图中省略。此类稀疏组的组级结果应被视为暂定而非确定。这在职业层面也更明显,见图4。对于有三个或更多条目的职业,容易执行的职业如电工、牙医和工业工程师在许多模型上出现在90%+范围。然而,也有许多职业在前沿模型上接近零。GPT-5.4总体为60.3%,但在精算师、钣金工或渔猎巡护员上没有一个种子正确,在空乘人员上为11%。
还存在非常大的跨模型差异。对于财务经理,GPT-5.4所有种子都正确,而GPT-3.5 Turbo一个都不正确。这些也是领域特定差异出现的例子,排行榜聚合无法捕捉。
图3:按模型划分的ORQA准确率SOC主要组热图。
注:SOC行聚合广泛BLS职业组内的条目级准确率。每个单元格平均该组内所有保留条目在模型三个种子上的表现。各组包含的职业数量差异很大,覆盖稀薄的组应据此解读。
困难条目是什么样的
ORQA的好处之一是它可以访问通常不包含在工作评估中的职业,因为它们属于物理或非数字世界。此外,困难条目可以是具体的而非抽象的。可以指出一些趋势。一是未能准确回忆特定代码和数值。例如,在关于屠宰工和切肉工的一个OSHA条目中,引用了当设备产生冲击或脉冲噪声时的特定暴露限值。模型在闭卷中似乎不擅长回忆这些具体值。另一个例子是关于工具和模具制造工的条目,引用了一份特定的机器安全文档。问题要求在点动冲床的冲头之前必须检查什么。
图4:职业层面热图显示模型特定的优势和失败。
注:职业按跨模型平均准确率排序,以便在视觉上区分简单和困难领域。单元格值总结职业内的模型准确率,应结合条目数量解读。
正确答案是具体行动,而不是“遵循所有安全程序”之类的内容。第二,许多失败是检索型的。问题的正确答案是来自某个权威来源的事实,具有网络搜索能力的模型可以检索到,但闭卷模型不能。一个空乘人员的例子使用了GoJet集体谈判协议中关于延误后下机再登机航班的登机报酬问题。闭卷模型在这个问题上表现很差,但具有网络搜索能力的模型表现良好,因为它可以检索集体谈判
协议。这些失败既说明了ORQA评估的知识类型(目前前沿模型中不具备的专业相关知识),也说明了闭卷表现与网络搜索表现之间可能存在巨大差距。
验证
我们对验证的主张相当保守。我们最强的主张是ORQA的排名不被独立外部证据所矛盾。由于目前没有可用的权威来源索引职业基准,我们比较三个外部指标,而不是期望与其中任何一个完全一致。第一,GDPval报告了在各自职业中针对专业专家的长篇表现。ORQA表现与GDPval胜率之间存在强相关(Spearman ρ=+0.90,Pearson r=+0.89),涉及与我们模型集合重叠的五个模型。第二,GDPval-AA,即GDPval的人工分析版本[?],报告了长篇经济任务上的盲 pairwise Elo。在与我们集合重叠的十一个模型中,Spearman ρ=+0.92,Pearson r=+0.93。在两个排行榜上,GPT-5.4、Claude Sonnet 4.6和Claude Opus 4.6的前沿都位居顶部。开放权重模型在两个排行榜上都处于较低位置,中间的相对排序基本保持。第三,我们将ORQA的覆盖范围与Anthropic经济指数[?]进行比较。我们根据观察到的Claude使用暴露度对职业进行分组。ORQA覆盖了高度使用的职业,也覆盖了在职场AI使用度量中因缺失而代表性不足的低使用职业。我们认为这些评估方法相当基础,针对跨职业人工编写的黄金答案进行更深入的评估将是有益的。
5 讨论
ORQA旨在成为一种创建与专业建议/指南相一致的来源 grounded 方法,而不是职业AI能力的完整表示。ORQA的关键优势是能够扩展到职业层面。许多职业都有权威材料,概述安全、专业标准、报告责任、阈值、程序等方面。这些可以转化为可测试的问题。与仅使用专家创建的工作样本测试相比,这使得比较能够覆盖职业版图中大得多的部分。然而,这种方法也引入了若干限制。
首先,应讨论该方法的一些局限性。ORQA使用权威材料作为 ground truth。然而,职业的某些方面并不仅存在于这些材料中。由于来源材料的相关性和完整性可能存在差异,ORQA的准确答案应被视为与特定权威或专业来源的一致,而不是表明模型会在专业情境中做出正确决策。第二,覆盖范围广泛但不均衡,总覆盖仍然相对有限:当前题库覆盖SOC全部21个主要组中的116个职业,但每个职业和某些SOC主要组的条目数量相当少(一些SOC主要组只有一两个职业)。一些职业(如生产和医疗保健职业)产生许多高质量、可溯源条目,而另一些只产生少数条目。少数SOC主要组(如农业、渔业和林业)也很稀疏,因为权威机器可读来源有限。因此,对于条目很少的职业的职业层面估计,以及对于覆盖稀薄的SOC组的SOC组层面估计,应被视为探索性而非确定排名。我们对推广到整个经济的说法也很谨慎:ORQA确实覆盖了经济中相当大且不断扩大的份额,但不是所有职业和部门。扩展题库以覆盖代表性不足且权威来源较少的职业和部门将是有用的。
第三,使用我们的来源可能带来记忆问题,因为它们可能存在于模型的预训练数据中。我们尝试通过附录A.3中包含的按模型预训练截止日期分层来经验性地解决污染问题。对于来自给定模型训练截止日期之后发布的段落的条目(因此对该模型无污染),15个分析模型中有14个的表现等于或优于截止日期前段落的表现。这与纯记忆假设下预期的表现相反。我们还通过分析开放式任务以及多项选择任务来提供另一种稳健性测试。这表明排名不仅仅是正确多项选择答案选择的函数。我们可以继续研究污染问题。ORQA也不促进显著的人-LLM来回交互或深度人类协作。因此我们认为ORQA是职业评估的一个要素。它为职业知识提供了有用的信号,但在实际使用前应与人在回路、基于任务和交互式评估结合使用。我们的方法也可用于未来使用AI智能体评估端到端职业任务。
我们的主要贡献是一种可扩展的职业评估方法。ORQA提供了一种将职业知识与权威在线资源连接起来,并将这些资源转化为来源可验证评估任务的方法,成本显著低于基于专家的评估。相同方法也可用于非权威资源。作为补充努力,我们还探索了一种基于社区线程的方法,将职业与Reddit线程连接(附录A.8)。上述若干问题可以很自然地成为未来研究的对象,而不是该方法的固有局限。更多模型和计算将允许探索更多来源、为每个职业产生更多候选条目、测试更多模型,并进行更深入的稳健性测试。更多人工策展将允许改善来源质量与现实世界实用性之间的对齐。我们相信这种方法为逐步更现实的职业层面评估提供了可扩展的基础,而不是评估现实世界表现的最终解决方案。