☰
Assessing the Reliability of Large Language Models for Deductive Qualitative Coding: A Comparativ...
2026/10/3 8:32:05 网站建设 项目流程

文章主要内容总结

本文聚焦大型语言模型(LLMs)在演绎定性编码中的可靠性评估,以ChatGPT为研究对象,通过比较议程项目(CAP)主编码手册,将美国最高法院案例摘要分类为21个主要政策领域,系统测试了四种干预策略(零样本、少样本、基于定义、分步任务分解)的效果。研究发现:

  1. 分步任务分解策略表现最优,准确率达0.775,Cohen’s κ为0.744,Krippendorff’s α为0.746,达到“实质性一致”阈值;
  2. 干预策略对分类结果影响显著(如基于定义与少样本策略的Cramér’s V=0.613);
  3. 即使案例摘要存在语义模糊,ChatGPT在不同样本中仍表现出稳定一致性,包括低支持度子类的高F1分数。

研究表明,通过针对性干预,LLMs可达到足以融入严谨定性编码工作流的可靠性水平。

创新点

  1. 聚焦未充分探索的领域:现有研究多关注LLMs在归纳编码中的应用,本文首次系统探究其在结构化演绎编码中的表现;
  2. 提出新型干预策略:设计“分步任务分解策略”,通过引导模型明确推理步骤(识别参与者、确定核心政策问题等),显著提升可靠性,效果优于传统零样本、少样本等方法;
  3. 多维度评估体系:结合准确率、F1分数、Cohen’s κ、Krippendorff’s α等指标,同时通过卡方检验和Cramér’s V分析结构效度,全面评估不同干预策略的差异及政策领域特异性。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询