返回主站 ↗

人工智能+ · 研究稿

人工智能应用的可靠性:写作、编程与工作流的验证框架

摘要

人工智能生成的内容,如何成为可以信赖的工作成果?本文围绕辅助写作、软件编程与工具工作流,通过叙述性文献分析,讨论生成表现与任务完成之间的差距,提出以事实依据、独立测试和最终状态为核心的验证框架。在写作中,事实支持程度应与信息完整性共同评价;在编程中,发现错误应与完成有效修复分别衡量;在工作流中,单次成功应与重复运行的可靠性加以区分。基于这些区别,本文提出相应的对照研究方案,将评价重点从生成内容的数量转向成果的可核查性及验证成本。本文属于概念性研究,未开展原创实验,框架的有效性仍需实证检验。

1 从生成能力到交付证据

生成式系统能够输出流畅文字、可执行代码和工具动作,但三者都不自动构成交付完成的证据。本文主张将评价对象从“模型产出了什么”转向“哪些主张与状态能够被外部核验”,并把证据支持、测试覆盖与终态校验作为不可互换的判断层次。这是一项概念性综合与研究议程,而非经实验证实的新算法。

2 文献范围与证据脉络

本文目的性选取 150 篇研究文献,按研究问题进行叙述性综合,不是系统综述或荟萃分析。所选文献首次提交于 2016—2025 年,未覆盖截至 2026 年的全部进展。2026 年 9 月 8 日核对题名、作者、提交日期、公开摘要、来源页与 PDF 入口;区分原始研究、技术报告和综述,不将它们视为同等强度的实验证据。对 FActScore、ALCE、EvalPlus 与 τ-bench 的相关方法段落此前进行了定向核查,未逐篇全文审查或复现实验。

Transformer 以注意力机制构建序列转换架构,为后续语言生成研究提供了重要技术基础。[1]GPT-3 研究展示了通过文本示例完成多种任务的少样本能力,同时报告了任务差异与训练语料带来的方法学问题。[2]

T5 将语言任务统一为文本到文本问题,并比较预训练目标、架构和数据等因素;任务形式的统一不等于评价标准相同。[3]BART 通过破坏文本再重建的去噪预训练研究生成与理解任务,说明训练目标是影响文本生成能力的一项设计因素。[4]

RAG 将参数化语言模型与外部检索记忆结合,使知识密集型生成任务能够利用检索段落。[5]REALM 把知识检索器纳入语言模型预训练,探索从大规模文档中获取知识,而非仅依赖模型参数保存事实。[6]

InstructGPT 通过人类示范与偏好反馈改进指令遵循;作者也明确指出,经过这一过程的模型仍会犯简单错误。[7]TruthfulQA 以容易诱发常见误解的问题评价回答真实性,提醒研究者区分语言模仿能力与事实正确性。[8]

FActScore 把长文本拆成原子事实,评价其中得到可靠知识来源支持的比例,而不是给整篇文字一个笼统的真假判断。[9]ALCE 将流畅度、正确性与引用质量分别评价;附有引文的回答,仍可能存在证据不能完整支撑论述的问题。[10]

Chain-of-Verification 采用初稿、验证问题、独立回答和修订的流程,在所研究任务中减少幻觉。[11]Lost in the Middle 发现相关信息在上下文中的位置会影响所测模型的表现,长输入容量并不自动保证充分利用全部材料。[12]

Codex 研究以 HumanEval 等任务检验从描述生成程序的功能正确性,并报告重复采样的作用与模型局限。[13]MBPP 所在研究以自然语言描述生成短 Python 程序为对象,提供了基础程序合成任务的评价依据。[14]

AlphaCode 将大规模候选采样与按程序行为筛选结合,用于竞赛编程;其评价对象不是长期维护中的完整软件系统。[15]Pearce 等在设定的安全相关场景中发现早期 Copilot 会生成含漏洞的代码;这一历史研究不能直接代表当前产品的漏洞率。[16]

CodeGen 研究把程序需求分解为多轮子问题,并通过专门基准考察多轮程序合成。[17]StarCoder 公开了代码模型研究,并讨论训练数据许可、个人信息处理和来源追踪等发布安排。[18]

Code Llama 提供代码生成、补全和指令跟随等模型变体,显示代码任务需要区分不同训练与使用条件。[19]EvalPlus 扩充程序合成基准的测试输入,发现原有测试未识别的错误;测试集的充分性会影响模型评价。[20]

SWE-bench 把真实代码仓库中的问题与修复作为任务,要求模型理解并协调跨函数、类或文件的修改。[21]SWE-agent 研究智能体与计算机交互界面的设计,考察代码导航、编辑和执行测试等操作如何影响修复表现。[22]

Agentless 采用定位、修复与补丁验证的简化流程,表明软件修复研究需要把简单流程纳入对照。[23]LiveCodeBench 持续收集新竞赛问题,并扩展到自修复、代码执行和测试输出预测,以研究评价污染及能力覆盖问题。[24]

Chain-of-Thought 研究通过中间推理示例改善特定算术、常识和符号任务表现,但不把输出的推理文字本身作为外部证据。[25]Self-Consistency 采样多条推理路径并汇总一致答案,在所测推理任务上取得改进。[26]

ReAct 交替组织推理与任务动作,使模型能够通过外部知识源或环境反馈更新行动。[27]Toolformer 研究模型学习何时调用 API、传递哪些参数,以及怎样把结果纳入后续生成。[28]

Reflexion 将任务反馈整理为文字反思并保留到后续尝试中,不通过更新模型权重完成这一适应过程。[29]Self-Refine 使用同一模型生成反馈并迭代修订,在多个任务上研究初稿之后的改进过程。[30]

Tree of Thoughts 把中间思路组织成可探索、评估和回溯的搜索过程,用于需要规划或搜索的任务。[31]AutoGen 以可配置的多智能体对话连接模型、工具和人工输入,提供构建不同协作模式的框架。[32]

AgentBench 在多种交互环境中评价智能体的推理与决策,分析长期推理、决策和指令遵循方面的失败。[33]WebArena 提供可复现的网站环境与长程任务,通过任务完成的功能正确性评价网页智能体。[34]

ToolLLM 围绕 API 使用构建数据、训练与评价流程,并研究工具检索及调用路径的搜索。[35]τ-bench 结合模拟用户、领域规则与 API 工具,比较交互结束后的数据库状态,并评价多次尝试中的可靠性。[36]

3 扩展研究基础与反证

以下扩展覆盖训练与数据条件、检索和事实评价、软件与工具环境,以及隐私、偏见和不确定性。各项仅概述公开摘要能够支持的研究对象或方法,不复述未经核实的成绩,也不因文献数量增加而宣称框架已经有效。引用的 arXiv 版本不等于期刊最终版本;来源真实存在不保证研究结论无误。

3.1 模型与表征基础

BERT 通过同时利用左右文学习双向表征,研究预训练向语言理解任务的迁移。[37] RoBERTa 通过复查 BERT 的训练配置分析数据量与超参数的影响,提示模型比较需要控制训练条件。[38]

XLNet 以排列分解次序的自回归目标学习双向上下文,提供了不同于掩码重建的训练路径。[39] GPT-4 技术报告描述图文输入、文本输出及基准评价;报告也承认模型在许多现实场景中仍弱于人类。[40]

LLaMA 研究以公开可获得的数据训练基础模型,提供了检查训练数据可获得性与模型能力关系的实例。[41] Llama 2 区分预训练模型与面向对话的微调版本;因此引用模型结果时需要标明具体变体。[42]

3.2 规模、数据与训练条件

Scaling Laws 研究交叉熵损失与参数量、数据量和训练计算量的经验关系,评价对象不是生产任务的可靠交付。[43] Chinchilla 研究在固定计算预算下联合分配模型规模与训练词元,不能把参数量单独作为能力解释。[44]

PaLM 考察规模扩大与少样本任务表现,并分析偏见、有害输出及记忆现象。[45] OPT 发布不同规模的预训练模型,并提供训练过程记录,以支持模型研究与复查。[46]

BLOOM 描述多语言及代码语料上的开放获取模型,说明评价还需要考虑训练语言构成。[47] Pythia 提供受控数据顺序与多个训练检查点,用于分析能力、记忆和偏见随训练的变化。[48]

3.3 任务适配与偏好学习

LoRA 冻结原有权重并训练低秩更新矩阵,研究减少任务适配时可训练参数的方法。[49] QLoRA 将量化的冻结模型与低秩适配结合,主要处理微调的内存需求。[50]

Prefix-Tuning 在冻结模型上学习连续的任务前缀,用于生成任务的轻量适配。[51] Prompt Tuning 通过反向传播学习软提示,并研究其效果如何随模型规模变化。[52]

DPO 将偏好学习转写为分类损失的优化;偏好一致性仍应与事实支持和任务完成分别检验。[53] Constitutional AI 以原则、自我批评和 AI 偏好反馈训练助手,其研究目标是行为约束而非普遍事实保证。[54]

3.4 数据记录、去重与来源

Datasheets for Datasets 建议记录数据集动机、组成、收集过程和推荐用途,为材料台账提供文档化参照。[55] Model Cards 建议公布模型适用场景、评价过程与不同条件下的表现,而不只给出单一分数。[56]

训练数据去重研究考察重复文本、记忆输出与训练测试重叠的关系。[57] Kandpal 等考察重复训练序列与隐私攻击的关系,并在所测条件下发现去重能够降低这类攻击的效果。[58]

Data Portraits 通过紧凑的数据记录支持训练材料成员查询,帮助检查测试集泄漏和内容来源。[59] Dolma 公开英语预训练语料及构建说明,为研究数据筛选如何影响模型提供可检查的材料。[60]

3.5 基准覆盖与评估方法

MMLU 通过多个学术与专业任务考察知识和问题求解,不能把其平均分视为所有应用的准确率。[61] BIG-bench 汇集多种任务并比较模型规模下的表现,显示能力评价需要跨任务观察。[62]

HELM 在多个场景同时评价准确性、校准、稳健性、公平性、偏见、有害输出与效率。[63] CheckList 以能力类别和测试类型组织行为测试,补充保留测试集平均准确率难以揭示的问题。[64]

Dynabench 通过人与模型共同参与的数据构建收集挑战样本,探索动态评价。[65] 神经网络校准研究检验置信度与正确概率的对应,并考察温度缩放;其分类实验不直接保证生成文本的置信度可靠。[66]

3.6 推理策略及其证据边界

Zero-shot-CoT 在所测推理任务中使用简短的逐步思考提示,研究不提供任务示例时的表现。[67] Least-to-Most 将复杂问题分成顺序求解的子问题,并利用前面得到的答案。[68]

PAL 让模型生成中间程序,把求解中的执行与计算交给解释器。[69] Program of Thoughts 同样区分推理表达与外部程序计算,并在数值推理任务中评价。[70]

不忠实推理解释研究发现,模型可能受到输入偏置影响,却不在思维链中说明这一影响。[71] 内在自我纠正研究发现,在缺少外部反馈的所测推理条件中,自我修订可能失败甚至降低表现。[72]

3.7 检索器与外部知识

DPR 使用双编码器学习问题与段落的稠密表示,研究开放域问答中的候选证据检索。[73] ColBERT 通过查询与文档表征的后期交互兼顾检索效果与计算效率。[74]

多段落检索与生成结合的研究考察如何汇总多个段落中的信息以回答开放域问题。[75] Atlas 研究少样本条件下的检索增强,并考察文档索引内容及更新的影响。[76]

RETRO 以检索到的文档块辅助词元预测,探索显式外部记忆与模型参数的配合。[77] BEIR 在异质任务上比较检索系统,提示在单一数据集上有效的方法未必能够跨域泛化。[78]

3.8 检索增强的控制与评价

Self-RAG 学习按需检索并生成反思标记,研究检索、生成与自我评价的联合控制。[79] CRAG 使用检索评价器判断文档质量并触发不同检索动作,针对检索错误研究纠偏。[80]

IRCoT 将检索与多步推理交替组织,使后续检索利用已经得到的中间信息。[81] FLARE 根据预计的后续句子进行主动检索,并在出现低置信度词元时重新生成句子。[82]

RAPTOR 递归聚类和摘要文本片段,构造不同抽象层次的检索树。[83] HyDE 先生成假设文档作为检索中介,再查找真实语料;假设文档本身不是可以引用的事实证据。[84]

3.9 事实核查与摘要忠实性

FEVER 将主张标为支持、反驳或信息不足,并在适用时记录证据句。[85] FactCC 所在研究联合判断摘要一致性、定位支持片段和冲突片段。[86]

Maynez 等通过人工评价考察摘要幻觉,区分对输入的忠实性与一般文本相似度指标。[87] SummEval 对自动评价指标、摘要模型及专家和众包标注进行统一比较。[88]

QAFactEval 分析问答式事实评价中问题生成和可回答性判断的影响,并比较其与蕴含评价的互补性。[89] TRUE 统一多个任务的数据进行样本级事实一致性评价,不只考察系统平均分之间的相关性。[90]

3.10 幻觉识别与语义支持

SelfCheckGPT 利用重复采样回答的一致性识别可疑内容;共同重复的错误仍不能因此成为外部事实。[91] HaluEval 使用生成及人工标注的样本检验模型识别幻觉的能力,其比例不能直接外推到所有回答。[92]

Ji 等的幻觉综述整理自然语言生成中的定义、评价与缓解方法,本文将其作为概念背景而非新增独立实验。[93] 语义不确定性研究按意义而非仅按字符串差异计算熵,以处理不同表述表达相同答案的问题。[94]

AlignScore 学习两段文本之间的信息对齐函数,用于多种事实一致性评价场景。[95] Ragas 分别考虑检索上下文、生成忠实性和输出质量,以支持缺少人工标准答案时的 RAG 评价。[96]

3.11 指令边界与安全评估

间接提示注入研究表明,外部检索内容中的恶意指令能够干扰模型应用,来源内容不能自动获得操作权限。[97] 可迁移对抗攻击研究在所测模型上寻找能够绕过对齐约束的输入后缀,揭示安全评价需要明确威胁模型。[98]

Instruction Hierarchy 研究训练模型区分不同优先级指令,处理低可信内容与高优先级要求的冲突。[99] HarmBench 为自动红队测试提供标准化比较框架,同时研究攻击与防御的评价。[100]

JailbreakBench 明确威胁模型、提示配置、评分和攻击记录,以改善越狱研究的可比较性。[101] SORRY-Bench 通过细分不安全主题与语言变体评价安全拒答,避免只在少数主题上测试。[102]

3.12 代码表征与程序生成

CodeBERT 学习自然语言与编程语言的共同表征,评价代码搜索和文档生成等任务。[103] GraphCodeBERT 将变量之间的数据流纳入预训练,而不只把代码视为词元序列。[104]

CodeT5 使用编码器—解码器结构和标识符感知任务,同时研究代码理解与生成。[105] CodeT 利用生成的测试及执行一致性选择候选程序;生成测试的正确性仍须单独审查。[106]

InCoder 研究带双向上下文的代码填空与从左到右的程序合成,区分编辑和续写需求。[107] PolyCoder 所在研究跨编程语言比较代码模型,强调代码语料和语言分布对评价的影响。[108]

3.13 跨文件上下文与执行基准

RepoCoder 通过迭代检索与生成利用仓库中的跨文件信息,研究代码补全。[109] RepoBench 分别设置检索、代码补全和组合流程任务,区分上下文获取与使用能力。[110]

CrossCodeEval 借助静态分析构造需要跨文件上下文的多语言补全任务。[111] DS-1000 围绕数据科学库构造程序任务,结合执行结果和 API 使用等表面约束评价。[112]

APPS 以不同难度的自然语言编程问题和测试用例考察程序生成。[113] CRUXEval 分别评价程序输入与输出预测,指出代码生成成绩与执行推断能力不能等同。[114]

3.14 执行反馈、训练与版本

CodeRL 用评论网络预测功能正确性,并结合测试反馈和强化学习研究代码生成。[115] Self-Debugging 通过程序解释和执行结果研究代码自我调试,其反馈条件不同于没有外部信息的内在自我纠正。[116]

LEVER 根据自然语言需求、候选程序及执行结果学习验证器,再用于候选排序。[117] DeepSeek-Coder 研究项目级代码语料和填空训练,说明仓库上下文与补全目标是可区分的训练因素。[118]

StarCoder2 与 The Stack v2 描述代码来源与训练数据构建,并报告不同语言和任务上的评价。[119] WizardCoder 将 Evol-Instruct 用于代码领域的指令微调,并在代码生成基准中评价。[120]

3.15 工具选择与交互记忆

Gorilla 将 API 文档检索与调用生成结合,并考察测试时文档变化的影响。[121] API-Bank 提供可运行工具和对话任务,区分 API 规划、检索与调用中的错误。[122]

HuggingGPT 以语言模型协调任务规划、模型选择、执行与结果汇总。[123] MRKL 提出连接语言模型、外部知识和离散推理模块的系统架构。[124]

Voyager 在 Minecraft 中结合课程、可执行技能库与环境反馈;游戏中的探索结果不直接证明现实流程的可靠性。[125] Generative Agents 以记忆、反思和规划模拟可信的人类行为,其行为可信度评价不同于业务任务正确性。[126]

3.16 可观察环境与任务终态

Mind2Web 汇集真实网站的任务与动作序列,研究跨网站和领域的泛化。[127] WorkArena 在企业软件中构造知识工作任务,并提供用于智能体交互评价的环境。[128]

OSWorld 以真实计算机环境、初始状态配置和执行判定脚本评价跨应用任务。[129] VisualWebArena 研究需要同时理解图像和文字的网页任务,补充纯文本观察的评价范围。[130]

AndroidWorld 用参数化任务及初始化、成功检查和清理逻辑评价移动端智能体。[131] AgentDojo 在不可信工具数据中加入提示注入测试,同时评价正常任务和受攻击条件。[132]

3.17 隐私、偏见与有害输出

训练数据提取研究展示了从 GPT-2 输出恢复训练文本的攻击实例,说明公开输入也可能涉及隐私风险。[133] 差分隐私深度学习研究通过训练算法与隐私成本分析限制数据泄漏风险,其保证依赖相应机制与假设。[134]

StereoSet 在英语语境中评价性别、职业、种族和宗教刻板印象;本文不把这些类别直接当成中文评价的完整清单。[135] CrowS-Pairs 以成对句子考察掩码语言模型对美国语境下社会刻板印象的偏好。[136]

RealToxicityPrompts 考察看似普通的提示是否也会引出有害输出,并比较生成控制方法。[137] BBQ 对比信息不足和信息充分的问答情境,研究社会偏见是否影响答案选择。[138]

3.18 不确定性与选择性回答

模型自我知识研究分别考察对答案正确性的估计与对能否回答的估计,并报告跨任务校准的困难。[139] Just Ask for Calibration 比较口头置信度和条件概率在所测问答基准上的校准表现。[140]

Linguistic Calibration 以用户能否据生成文本形成校准的概率判断为目标,研究长文本置信表达。[141] Conformal Language Modeling 校准候选答案的采样停止和拒绝规则,研究带统计保证的答案集合,而非保证每次单一回答正确。[142]

选择性分类研究以拒绝部分样本换取风险控制,为同时报告覆盖率与错误率提供方法参照。[143] 风险控制预测集研究使用保留数据校准集合大小与期望损失,其保证不能脱离原定采样和校准条件。[144]

3.19 后续模型与推理训练

DeepSeek-R1 研究强化学习对推理能力的激励,并讨论可验证任务中的表现;本文不据此推断开放式事实陈述必然正确。[145] Qwen3 报告思考与非思考模式及推理预算控制,进一步说明评价应同时记录模式和计算预算。[146]

DeepSeek-V3 描述混合专家结构、负载均衡与多词元预测训练,不同的激活参数量和总参数量应分别记录。[147] Llama 3 报告多语言、代码、推理和工具使用评价,并区分预训练、后训练与多模态实验。[148]

OLMo 2 提供权重、训练数据、训练记录和中间检查点,说明开放权重与完整训练材料可获得性不是同一条件。[149] Qwen2.5 描述预训练与后训练改进及不同发布版本,引用其结果时不能省略所用模型的身份。[150]

4 跨任务的证据框架

本文不把不同基准的成绩合并成排行榜,而是区分三个验收对象:写作中的主张、编程中的补丁和工作流中的状态转移。三者共享“任务—约束—产物—检查—终态”的记录结构,但不能共享一个未经验证的总分;高质量引文无法替代代码测试,成功回执也不能替代最终状态检查。

表 1|拟议框架,不含实测结果
任务证据对象评价维度
写作主张与原文位置支持、覆盖与核验成本
编程版本差异与独立测试有效修复、回归与审查成本
工作流权限记录与可观察终态重复可靠性、接管与恢复成本

5 可反驳的研究命题

H1:在必需事实覆盖率和拒答率不劣于基线的条件下,证据台账能否提高事实支持比例?如果提升只来自省略困难主张,假设不获支持。

以人工写作、直接生成、检索后生成为基线;完整流程增加证据台账和独立审核。分别移除台账、独立审核进行消融,固定材料、模型版本、检索集合和总时间预算。

H2:在固定修改范围和成本预算下,独立测试是否提升最终补丁的有效修复比例,而不仅是检出更多错误?若检出率提高但最终可用补丁未增加,应分别报告,不认定修复有效性提高。

对照人工修复、单轮生成与简化定位—修复—验证流程;完整流程加入独立测试与回归门禁。冻结基准版本,隔离补丁生成者与保留测试,记录依赖和环境散列。

H3:状态校验与幂等重试能否在不扩大权限、不提高人工接管率的条件下提高重复可靠性?若收益依赖额外人工干预或更宽权限,则不能归因于工作流结构本身。

比较单流程、多智能体协作和带状态校验的流程;模型、工具权限、预算与任务保持一致。分别移除状态校验和重试保护,并在可恢复环境注入超时、重复响应及部分失败。

6 操作定义与判定边界

设 Sᵢ 为任务 i 中有证据支持的可核查主张集合,Aᵢ 为全部可核查主张集合;Kᵢ 为预先规定的必需事实,Dᵢ 为输出中正确保留的必需事实。分别报告事实支持比例 Pᵢ 与覆盖率 Cᵢ,避免以少说或不说获得虚高分。分母为零时记为不适用,另报拒答和遗漏。

Pᵢ = |Sᵢ| / |Aᵢ|;   Cᵢ = |Dᵢ| / |Kᵢ|(1)

代码任务仅在预定义问题得到修复、独立验收通过且必要回归检查未失败时记为有效修复,同时单列安全审查和目标环境覆盖范围。这个操作定义受测试充分性限制,不等于证明程序对所有输入正确。检出错误数、最终修复数及审查耗时不可互相替代。

设 yᵢⱼ∈{0,1} 表示任务 i 在第 j 次运行中同时满足终态和规则要求,N 为任务数,k 为每个任务固定运行次数。R_all,k 衡量每次均成功的任务比例;R_any,k 衡量至少一次成功的任务比例。二者须与 k、预算和接管率共同报告,不可用总体平均成功率的 k 次方替代。

R_all,k = (1/N) Σᵢ Πⱼ yᵢⱼ(2)
R_any,k = (1/N) Σᵢ [1 − Πⱼ (1 − yᵢⱼ)](3)

7 可检验的评价方案

以任务而非同一任务的重复输出为独立抽样单位。先用独立先导样本确定标注可行性、成本与效应量范围,再据精度或功效目标确定正式样本量;先导集不进入保留评估集。中文和英文任务分别分层,翻译对应的任务视为配对而非独立样本。公开任务纳入与排除标准,冻结输入、版本、权限及预算。

条件顺序随机化,同一任务成对比较;评审者在可行时不知道任务所属条件。报告原始计数、任务层面的效应差与区间,不把重复运行当作额外独立任务。对多任务族分层汇报,并进行缺失与超时处理的敏感性分析。超时、拒答和人工接管保留且分别计数;若需更改原定方案,应说明变更时间和理由。

复核材料应包含任务清单、数据授权状态、模型与工具版本、提示模板、随机种子(如可设定)、测试与判定规则、失败日志和分析脚本。含个人或受限信息的材料不因复现需要而直接公开;可发布脱敏结构和受控访问说明。上述材料是拟议的研究产物,本站目前不提供已完成实验的数据集或分析代码。

8 反例、局限与适用边界

更多核验未必总是更好:可靠的证据台账可能增加审查成本,错误测试可能拒绝正确补丁,终态检查可能遗漏隐含需求。低风险、可逆任务中,轻量流程或人工处理可能更经济。若额外检查只提高成本而未改善预定义结果,本文提出的强化流程应被缩减或否定,而不是事后改写成功标准。

FActScore 的主要评估场景是人物传记与相应知识源,不能直接证明复杂因果论述的真实性;ALCE 的自动蕴含判定也会出错。因此,下面的主张比例是本文建议的操作定义,不是完整复现这些评测。[9][10]

EvalPlus 表明更充分的测试能暴露既有评估遗漏的错误,其研究也讨论参考实现错误。这不意味着增加测试即可证明所有输入均正确;测试可靠性和最终补丁正确性必须分开审查。[20]

τ-bench 结合最终数据库状态与必要回复检查任务完成。本文借鉴其“至少一次成功”与“重复均成功”的区分,但下式是固定 k 次试验的直接经验统计,不是原文组合估计量,也不要求描述性计算满足独立同分布。[36]

目的性选文、摘要层面的主要核查和缺少原创数据限制了本稿的结论。当前参考集合不足以证明截至 2026 年的研究空白,更不能支撑优先权声明。正式投稿前需要更新检索、逐篇关键方法审查、核实版本与出版信息,并请相应领域研究者审定论点;若主张有效性,则还须完成上述研究。

9 结论

人工智能应用的可靠性不应仅由生成表现定义。本文提出按证据支持、独立测试和任务终态分层验收,并给出可被反驳的假设与评价边界。其价值是明确应如何验证,而不是提前宣告方案有效。

11 声明与可用性

数据与代码:本文未生成原创实验数据;文献来源逐项链接。实验与分析代码尚未实现,不将网页代码作为实验复现包。

作者、贡献、资助与利益冲突:Alsay 是网页发布主体,不据此推定学术作者身份。真实作者名单、贡献分工、资助和利益冲突须由责任人确认;本稿不代填“无利益冲突”,也不虚构单位、学位或伦理批准。

AI 使用与版本:检索、结构组织、文字编辑和中英翻译使用 AI 辅助。两版为同一研究稿的对应语言版本,不是两项独立研究;责任作者的学术审定仍待完成。本文未宣称经同行评审、被期刊录用或已完成预注册。

参考文献

按 arXiv 公开版本著录,未逐篇核实同行评审状态。来源页与 PDF 入口于 2026-09-08 检查可访问;不保证长期可用或全文结论正确。

  1. [1] Vaswani, Ashish; Shazeer, Noam; Parmar, Niki; et al.. Attention Is All You Need. arXiv:1706.03762 (2017). doi:10.48550/arXiv.1706.03762. PDF. ↩1
  2. [2] Brown, Tom B.; Mann, Benjamin; Ryder, Nick; et al.. Language Models are Few-Shot Learners. arXiv:2005.14165 (2020). doi:10.48550/arXiv.2005.14165. PDF. ↩1
  3. [3] Raffel, Colin; Shazeer, Noam; Roberts, Adam; et al.. Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer. arXiv:1910.10683 (2019). doi:10.48550/arXiv.1910.10683. PDF. ↩1
  4. [4] Lewis, Mike; Liu, Yinhan; Goyal, Naman; et al.. BART: Denoising Sequence-to-Sequence Pre-training for Natural Language Generation, Translation, and Comprehension. arXiv:1910.13461 (2019). doi:10.48550/arXiv.1910.13461. PDF. ↩1
  5. [5] Lewis, Patrick; Perez, Ethan; Piktus, Aleksandra; et al.. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. arXiv:2005.11401 (2020). doi:10.48550/arXiv.2005.11401. PDF. ↩1
  6. [6] Guu, Kelvin; Lee, Kenton; Tung, Zora; et al.. REALM: Retrieval-Augmented Language Model Pre-Training. arXiv:2002.08909 (2020). doi:10.48550/arXiv.2002.08909. PDF. ↩1
  7. [7] Ouyang, Long; Wu, Jeff; Jiang, Xu; et al.. Training language models to follow instructions with human feedback. arXiv:2203.02155 (2022). doi:10.48550/arXiv.2203.02155. PDF. ↩1
  8. [8] Lin, Stephanie; Hilton, Jacob; Evans, Owain. TruthfulQA: Measuring How Models Mimic Human Falsehoods. arXiv:2109.07958 (2021). doi:10.48550/arXiv.2109.07958. PDF. ↩1
  9. [9] Min, Sewon; Krishna, Kalpesh; Lyu, Xinxi; et al.. FActScore: Fine-grained Atomic Evaluation of Factual Precision in Long Form Text Generation. arXiv:2305.14251 (2023). doi:10.48550/arXiv.2305.14251. PDF. ↩1 ↩2
  10. [10] Gao, Tianyu; Yen, Howard; Yu, Jiatong; et al.. Enabling Large Language Models to Generate Text with Citations. arXiv:2305.14627 (2023). doi:10.48550/arXiv.2305.14627. PDF. ↩1 ↩2
  11. [11] Dhuliawala, Shehzaad; Komeili, Mojtaba; Xu, Jing; et al.. Chain-of-Verification Reduces Hallucination in Large Language Models. arXiv:2309.11495 (2023). doi:10.48550/arXiv.2309.11495. PDF. ↩1
  12. [12] Liu, Nelson F.; Lin, Kevin; Hewitt, John; et al.. Lost in the Middle: How Language Models Use Long Contexts. arXiv:2307.03172 (2023). doi:10.48550/arXiv.2307.03172. PDF. ↩1
  13. [13] Chen, Mark; Tworek, Jerry; Jun, Heewoo; et al.. Evaluating Large Language Models Trained on Code. arXiv:2107.03374 (2021). doi:10.48550/arXiv.2107.03374. PDF. ↩1
  14. [14] Austin, Jacob; Odena, Augustus; Nye, Maxwell; et al.. Program Synthesis with Large Language Models. arXiv:2108.07732 (2021). doi:10.48550/arXiv.2108.07732. PDF. ↩1
  15. [15] Li, Yujia; Choi, David; Chung, Junyoung; et al.. Competition-Level Code Generation with AlphaCode. arXiv:2203.07814 (2022). doi:10.48550/arXiv.2203.07814. PDF. ↩1
  16. [16] Pearce, Hammond; Ahmad, Baleegh; Tan, Benjamin; et al.. Asleep at the Keyboard? Assessing the Security of GitHub Copilot's Code Contributions. arXiv:2108.09293 (2021). doi:10.48550/arXiv.2108.09293. PDF. ↩1
  17. [17] Nijkamp, Erik; Pang, Bo; Hayashi, Hiroaki; et al.. CodeGen: An Open Large Language Model for Code with Multi-Turn Program Synthesis. arXiv:2203.13474 (2022). doi:10.48550/arXiv.2203.13474. PDF. ↩1
  18. [18] Li, Raymond; Allal, Loubna Ben; Zi, Yangtian; et al.. StarCoder: may the source be with you!. arXiv:2305.06161 (2023). doi:10.48550/arXiv.2305.06161. PDF. ↩1
  19. [19] Rozière, Baptiste; Gehring, Jonas; Gloeckle, Fabian; et al.. Code Llama: Open Foundation Models for Code. arXiv:2308.12950 (2023). doi:10.48550/arXiv.2308.12950. PDF. ↩1
  20. [20] Liu, Jiawei; Xia, Chunqiu Steven; Wang, Yuyao; et al.. Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation. arXiv:2305.01210 (2023). doi:10.48550/arXiv.2305.01210. PDF. ↩1 ↩2
  21. [21] Jimenez, Carlos E.; Yang, John; Wettig, Alexander; et al.. SWE-bench: Can Language Models Resolve Real-World GitHub Issues?. arXiv:2310.06770 (2023). doi:10.48550/arXiv.2310.06770. PDF. ↩1
  22. [22] Yang, John; Jimenez, Carlos E.; Wettig, Alexander; et al.. SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering. arXiv:2405.15793 (2024). doi:10.48550/arXiv.2405.15793. PDF. ↩1
  23. [23] Xia, Chunqiu Steven; Deng, Yinlin; Dunn, Soren; et al.. Agentless: Demystifying LLM-based Software Engineering Agents. arXiv:2407.01489 (2024). doi:10.48550/arXiv.2407.01489. PDF. ↩1
  24. [24] Jain, Naman; Han, King; Gu, Alex; et al.. LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code. arXiv:2403.07974 (2024). doi:10.48550/arXiv.2403.07974. PDF. ↩1
  25. [25] Wei, Jason; Wang, Xuezhi; Schuurmans, Dale; et al.. Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. arXiv:2201.11903 (2022). doi:10.48550/arXiv.2201.11903. PDF. ↩1
  26. [26] Wang, Xuezhi; Wei, Jason; Schuurmans, Dale; et al.. Self-Consistency Improves Chain of Thought Reasoning in Language Models. arXiv:2203.11171 (2022). doi:10.48550/arXiv.2203.11171. PDF. ↩1
  27. [27] Yao, Shunyu; Zhao, Jeffrey; Yu, Dian; et al.. ReAct: Synergizing Reasoning and Acting in Language Models. arXiv:2210.03629 (2022). doi:10.48550/arXiv.2210.03629. PDF. ↩1
  28. [28] Schick, Timo; Dwivedi-Yu, Jane; Dessì, Roberto; et al.. Toolformer: Language Models Can Teach Themselves to Use Tools. arXiv:2302.04761 (2023). doi:10.48550/arXiv.2302.04761. PDF. ↩1
  29. [29] Shinn, Noah; Cassano, Federico; Berman, Edward; et al.. Reflexion: Language Agents with Verbal Reinforcement Learning. arXiv:2303.11366 (2023). doi:10.48550/arXiv.2303.11366. PDF. ↩1
  30. [30] Madaan, Aman; Tandon, Niket; Gupta, Prakhar; et al.. Self-Refine: Iterative Refinement with Self-Feedback. arXiv:2303.17651 (2023). doi:10.48550/arXiv.2303.17651. PDF. ↩1
  31. [31] Yao, Shunyu; Yu, Dian; Zhao, Jeffrey; et al.. Tree of Thoughts: Deliberate Problem Solving with Large Language Models. arXiv:2305.10601 (2023). doi:10.48550/arXiv.2305.10601. PDF. ↩1
  32. [32] Wu, Qingyun; Bansal, Gagan; Zhang, Jieyu; et al.. AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation. arXiv:2308.08155 (2023). doi:10.48550/arXiv.2308.08155. PDF. ↩1
  33. [33] Liu, Xiao; Yu, Hao; Zhang, Hanchen; et al.. AgentBench: Evaluating LLMs as Agents. arXiv:2308.03688 (2023). doi:10.48550/arXiv.2308.03688. PDF. ↩1
  34. [34] Zhou, Shuyan; Xu, Frank F.; Zhu, Hao; et al.. WebArena: A Realistic Web Environment for Building Autonomous Agents. arXiv:2307.13854 (2023). doi:10.48550/arXiv.2307.13854. PDF. ↩1
  35. [35] Qin, Yujia; Liang, Shihao; Ye, Yining; et al.. ToolLLM: Facilitating Large Language Models to Master 16000+ Real-world APIs. arXiv:2307.16789 (2023). doi:10.48550/arXiv.2307.16789. PDF. ↩1
  36. [36] Yao, Shunyu; Shinn, Noah; Razavi, Pedram; et al.. τ-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains. arXiv:2406.12045 (2024). doi:10.48550/arXiv.2406.12045. PDF. ↩1 ↩2
  37. [37] Devlin, Jacob; Chang, Ming-Wei; Lee, Kenton; et al.. BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. arXiv:1810.04805 (2018). doi:10.48550/arXiv.1810.04805. PDF. ↩1
  38. [38] Liu, Yinhan; Ott, Myle; Goyal, Naman; et al.. RoBERTa: A Robustly Optimized BERT Pretraining Approach. arXiv:1907.11692 (2019). doi:10.48550/arXiv.1907.11692. PDF. ↩1
  39. [39] Yang, Zhilin; Dai, Zihang; Yang, Yiming; et al.. XLNet: Generalized Autoregressive Pretraining for Language Understanding. arXiv:1906.08237 (2019). doi:10.48550/arXiv.1906.08237. PDF. ↩1
  40. [40] OpenAI; Achiam, Josh; Adler, Steven; et al.. GPT-4 Technical Report. arXiv:2303.08774 (2023). doi:10.48550/arXiv.2303.08774. PDF. ↩1
  41. [41] Touvron, Hugo; Lavril, Thibaut; Izacard, Gautier; et al.. LLaMA: Open and Efficient Foundation Language Models. arXiv:2302.13971 (2023). doi:10.48550/arXiv.2302.13971. PDF. ↩1
  42. [42] Touvron, Hugo; Martin, Louis; Stone, Kevin; et al.. Llama 2: Open Foundation and Fine-Tuned Chat Models. arXiv:2307.09288 (2023). doi:10.48550/arXiv.2307.09288. PDF. ↩1
  43. [43] Kaplan, Jared; McCandlish, Sam; Henighan, Tom; et al.. Scaling Laws for Neural Language Models. arXiv:2001.08361 (2020). doi:10.48550/arXiv.2001.08361. PDF. ↩1
  44. [44] Hoffmann, Jordan; Borgeaud, Sebastian; Mensch, Arthur; et al.. Training Compute-Optimal Large Language Models. arXiv:2203.15556 (2022). doi:10.48550/arXiv.2203.15556. PDF. ↩1
  45. [45] Chowdhery, Aakanksha; Narang, Sharan; Devlin, Jacob; et al.. PaLM: Scaling Language Modeling with Pathways. arXiv:2204.02311 (2022). doi:10.48550/arXiv.2204.02311. PDF. ↩1
  46. [46] Zhang, Susan; Roller, Stephen; Goyal, Naman; et al.. OPT: Open Pre-trained Transformer Language Models. arXiv:2205.01068 (2022). doi:10.48550/arXiv.2205.01068. PDF. ↩1
  47. [47] Workshop, BigScience; :; Scao, Teven Le; et al.. BLOOM: A 176B-Parameter Open-Access Multilingual Language Model. arXiv:2211.05100 (2022). doi:10.48550/arXiv.2211.05100. PDF. ↩1
  48. [48] Biderman, Stella; Schoelkopf, Hailey; Anthony, Quentin; et al.. Pythia: A Suite for Analyzing Large Language Models Across Training and Scaling. arXiv:2304.01373 (2023). doi:10.48550/arXiv.2304.01373. PDF. ↩1
  49. [49] Hu, Edward J.; Shen, Yelong; Wallis, Phillip; et al.. LoRA: Low-Rank Adaptation of Large Language Models. arXiv:2106.09685 (2021). doi:10.48550/arXiv.2106.09685. PDF. ↩1
  50. [50] Dettmers, Tim; Pagnoni, Artidoro; Holtzman, Ari; et al.. QLoRA: Efficient Finetuning of Quantized LLMs. arXiv:2305.14314 (2023). doi:10.48550/arXiv.2305.14314. PDF. ↩1
  51. [51] Li, Xiang Lisa; Liang, Percy. Prefix-Tuning: Optimizing Continuous Prompts for Generation. arXiv:2101.00190 (2021). doi:10.48550/arXiv.2101.00190. PDF. ↩1
  52. [52] Lester, Brian; Al-Rfou, Rami; Constant, Noah. The Power of Scale for Parameter-Efficient Prompt Tuning. arXiv:2104.08691 (2021). doi:10.48550/arXiv.2104.08691. PDF. ↩1
  53. [53] Rafailov, Rafael; Sharma, Archit; Mitchell, Eric; et al.. Direct Preference Optimization: Your Language Model is Secretly a Reward Model. arXiv:2305.18290 (2023). doi:10.48550/arXiv.2305.18290. PDF. ↩1
  54. [54] Bai, Yuntao; Kadavath, Saurav; Kundu, Sandipan; et al.. Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073 (2022). doi:10.48550/arXiv.2212.08073. PDF. ↩1
  55. [55] Gebru, Timnit; Morgenstern, Jamie; Vecchione, Briana; et al.. Datasheets for Datasets. arXiv:1803.09010 (2018). doi:10.48550/arXiv.1803.09010. PDF. ↩1
  56. [56] Mitchell, Margaret; Wu, Simone; Zaldivar, Andrew; et al.. Model Cards for Model Reporting. arXiv:1810.03993 (2018). doi:10.48550/arXiv.1810.03993. PDF. ↩1
  57. [57] Lee, Katherine; Ippolito, Daphne; Nystrom, Andrew; et al.. Deduplicating Training Data Makes Language Models Better. arXiv:2107.06499 (2021). doi:10.48550/arXiv.2107.06499. PDF. ↩1
  58. [58] Kandpal, Nikhil; Wallace, Eric; Raffel, Colin. Deduplicating Training Data Mitigates Privacy Risks in Language Models. arXiv:2202.06539 (2022). doi:10.48550/arXiv.2202.06539. PDF. ↩1
  59. [59] Marone, Marc; Van Durme, Benjamin. Data Portraits: Recording Foundation Model Training Data. arXiv:2303.03919 (2023). doi:10.48550/arXiv.2303.03919. PDF. ↩1
  60. [60] Soldaini, Luca; Kinney, Rodney; Bhagia, Akshita; et al.. Dolma: an Open Corpus of Three Trillion Tokens for Language Model Pretraining Research. arXiv:2402.00159 (2024). doi:10.48550/arXiv.2402.00159. PDF. ↩1
  61. [61] Hendrycks, Dan; Burns, Collin; Basart, Steven; et al.. Measuring Massive Multitask Language Understanding. arXiv:2009.03300 (2020). doi:10.48550/arXiv.2009.03300. PDF. ↩1
  62. [62] Srivastava, Aarohi; Rastogi, Abhinav; Rao, Abhishek; et al.. Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models. arXiv:2206.04615 (2022). doi:10.48550/arXiv.2206.04615. PDF. ↩1
  63. [63] Liang, Percy; Bommasani, Rishi; Lee, Tony; et al.. Holistic Evaluation of Language Models. arXiv:2211.09110 (2022). doi:10.48550/arXiv.2211.09110. PDF. ↩1
  64. [64] Ribeiro, Marco Tulio; Wu, Tongshuang; Guestrin, Carlos; et al.. Beyond Accuracy: Behavioral Testing of NLP models with CheckList. arXiv:2005.04118 (2020). doi:10.48550/arXiv.2005.04118. PDF. ↩1
  65. [65] Kiela, Douwe; Bartolo, Max; Nie, Yixin; et al.. Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337 (2021). doi:10.48550/arXiv.2104.14337. PDF. ↩1
  66. [66] Guo, Chuan; Pleiss, Geoff; Sun, Yu; et al.. On Calibration of Modern Neural Networks. arXiv:1706.04599 (2017). doi:10.48550/arXiv.1706.04599. PDF. ↩1
  67. [67] Kojima, Takeshi; Gu, Shixiang Shane; Reid, Machel; et al.. Large Language Models are Zero-Shot Reasoners. arXiv:2205.11916 (2022). doi:10.48550/arXiv.2205.11916. PDF. ↩1
  68. [68] Zhou, Denny; Schärli, Nathanael; Hou, Le; et al.. Least-to-Most Prompting Enables Complex Reasoning in Large Language Models. arXiv:2205.10625 (2022). doi:10.48550/arXiv.2205.10625. PDF. ↩1
  69. [69] Gao, Luyu; Madaan, Aman; Zhou, Shuyan; et al.. PAL: Program-aided Language Models. arXiv:2211.10435 (2022). doi:10.48550/arXiv.2211.10435. PDF. ↩1
  70. [70] Chen, Wenhu; Ma, Xueguang; Wang, Xinyi; et al.. Program of Thoughts Prompting: Disentangling Computation from Reasoning for Numerical Reasoning Tasks. arXiv:2211.12588 (2022). doi:10.48550/arXiv.2211.12588. PDF. ↩1
  71. [71] Turpin, Miles; Michael, Julian; Perez, Ethan; et al.. Language Models Don't Always Say What They Think: Unfaithful Explanations in Chain-of-Thought Prompting. arXiv:2305.04388 (2023). doi:10.48550/arXiv.2305.04388. PDF. ↩1
  72. [72] Huang, Jie; Chen, Xinyun; Mishra, Swaroop; et al.. Large Language Models Cannot Self-Correct Reasoning Yet. arXiv:2310.01798 (2023). doi:10.48550/arXiv.2310.01798. PDF. ↩1
  73. [73] Karpukhin, Vladimir; Oğuz, Barlas; Min, Sewon; et al.. Dense Passage Retrieval for Open-Domain Question Answering. arXiv:2004.04906 (2020). doi:10.48550/arXiv.2004.04906. PDF. ↩1
  74. [74] Khattab, Omar; Zaharia, Matei. ColBERT: Efficient and Effective Passage Search via Contextualized Late Interaction over BERT. arXiv:2004.12832 (2020). doi:10.48550/arXiv.2004.12832. PDF. ↩1
  75. [75] Izacard, Gautier; Grave, Edouard. Leveraging Passage Retrieval with Generative Models for Open Domain Question Answering. arXiv:2007.01282 (2020). doi:10.48550/arXiv.2007.01282. PDF. ↩1
  76. [76] Izacard, Gautier; Lewis, Patrick; Lomeli, Maria; et al.. Atlas: Few-shot Learning with Retrieval Augmented Language Models. arXiv:2208.03299 (2022). doi:10.48550/arXiv.2208.03299. PDF. ↩1
  77. [77] Borgeaud, Sebastian; Mensch, Arthur; Hoffmann, Jordan; et al.. Improving language models by retrieving from trillions of tokens. arXiv:2112.04426 (2021). doi:10.48550/arXiv.2112.04426. PDF. ↩1
  78. [78] Thakur, Nandan; Reimers, Nils; Rücklé, Andreas; et al.. BEIR: A Heterogenous Benchmark for Zero-shot Evaluation of Information Retrieval Models. arXiv:2104.08663 (2021). doi:10.48550/arXiv.2104.08663. PDF. ↩1
  79. [79] Asai, Akari; Wu, Zeqiu; Wang, Yizhong; et al.. Self-RAG: Learning to Retrieve, Generate, and Critique through Self-Reflection. arXiv:2310.11511 (2023). doi:10.48550/arXiv.2310.11511. PDF. ↩1
  80. [80] Yan, Shi-Qi; Gu, Jia-Chen; Zhu, Yun; et al.. Corrective Retrieval Augmented Generation. arXiv:2401.15884 (2024). doi:10.48550/arXiv.2401.15884. PDF. ↩1
  81. [81] Trivedi, Harsh; Balasubramanian, Niranjan; Khot, Tushar; et al.. Interleaving Retrieval with Chain-of-Thought Reasoning for Knowledge-Intensive Multi-Step Questions. arXiv:2212.10509 (2022). doi:10.48550/arXiv.2212.10509. PDF. ↩1
  82. [82] Jiang, Zhengbao; Xu, Frank F.; Gao, Luyu; et al.. Active Retrieval Augmented Generation. arXiv:2305.06983 (2023). doi:10.48550/arXiv.2305.06983. PDF. ↩1
  83. [83] Sarthi, Parth; Abdullah, Salman; Tuli, Aditi; et al.. RAPTOR: Recursive Abstractive Processing for Tree-Organized Retrieval. arXiv:2401.18059 (2024). doi:10.48550/arXiv.2401.18059. PDF. ↩1
  84. [84] Gao, Luyu; Ma, Xueguang; Lin, Jimmy; et al.. Precise Zero-Shot Dense Retrieval without Relevance Labels. arXiv:2212.10496 (2022). doi:10.48550/arXiv.2212.10496. PDF. ↩1
  85. [85] Thorne, James; Vlachos, Andreas; Christodoulopoulos, Christos; et al.. FEVER: a large-scale dataset for Fact Extraction and VERification. arXiv:1803.05355 (2018). doi:10.48550/arXiv.1803.05355. PDF. ↩1
  86. [86] Kryściński, Wojciech; McCann, Bryan; Xiong, Caiming; et al.. Evaluating the Factual Consistency of Abstractive Text Summarization. arXiv:1910.12840 (2019). doi:10.48550/arXiv.1910.12840. PDF. ↩1
  87. [87] Maynez, Joshua; Narayan, Shashi; Bohnet, Bernd; et al.. On Faithfulness and Factuality in Abstractive Summarization. arXiv:2005.00661 (2020). doi:10.48550/arXiv.2005.00661. PDF. ↩1
  88. [88] Fabbri, Alexander R.; Kryściński, Wojciech; McCann, Bryan; et al.. SummEval: Re-evaluating Summarization Evaluation. arXiv:2007.12626 (2020). doi:10.48550/arXiv.2007.12626. PDF. ↩1
  89. [89] Fabbri, Alexander R.; Wu, Chien-Sheng; Liu, Wenhao; et al.. QAFactEval: Improved QA-Based Factual Consistency Evaluation for Summarization. arXiv:2112.08542 (2021). doi:10.48550/arXiv.2112.08542. PDF. ↩1
  90. [90] Honovich, Or; Aharoni, Roee; Herzig, Jonathan; et al.. TRUE: Re-evaluating Factual Consistency Evaluation. arXiv:2204.04991 (2022). doi:10.48550/arXiv.2204.04991. PDF. ↩1
  91. [91] Manakul, Potsawee; Liusie, Adian; Gales, Mark J. F.. SelfCheckGPT: Zero-Resource Black-Box Hallucination Detection for Generative Large Language Models. arXiv:2303.08896 (2023). doi:10.48550/arXiv.2303.08896. PDF. ↩1
  92. [92] Li, Junyi; Cheng, Xiaoxue; Zhao, Wayne Xin; et al.. HaluEval: A Large-Scale Hallucination Evaluation Benchmark for Large Language Models. arXiv:2305.11747 (2023). doi:10.48550/arXiv.2305.11747. PDF. ↩1
  93. [93] Ji, Ziwei; Lee, Nayeon; Frieske, Rita; et al.. Survey of Hallucination in Natural Language Generation. arXiv:2202.03629 (2022). doi:10.48550/arXiv.2202.03629. PDF. ↩1
  94. [94] Kuhn, Lorenz; Gal, Yarin; Farquhar, Sebastian. Semantic Uncertainty: Linguistic Invariances for Uncertainty Estimation in Natural Language Generation. arXiv:2302.09664 (2023). doi:10.48550/arXiv.2302.09664. PDF. ↩1
  95. [95] Zha, Yuheng; Yang, Yichi; Li, Ruichen; et al.. AlignScore: Evaluating Factual Consistency with a Unified Alignment Function. arXiv:2305.16739 (2023). doi:10.48550/arXiv.2305.16739. PDF. ↩1
  96. [96] Es, Shahul; James, Jithin; Espinosa-Anke, Luis; et al.. Ragas: Automated Evaluation of Retrieval Augmented Generation. arXiv:2309.15217 (2023). doi:10.48550/arXiv.2309.15217. PDF. ↩1
  97. [97] Greshake, Kai; Abdelnabi, Sahar; Mishra, Shailesh; et al.. Not what you've signed up for: Compromising Real-World LLM-Integrated Applications with Indirect Prompt Injection. arXiv:2302.12173 (2023). doi:10.48550/arXiv.2302.12173. PDF. ↩1
  98. [98] Zou, Andy; Wang, Zifan; Carlini, Nicholas; et al.. Universal and Transferable Adversarial Attacks on Aligned Language Models. arXiv:2307.15043 (2023). doi:10.48550/arXiv.2307.15043. PDF. ↩1
  99. [99] Wallace, Eric; Xiao, Kai; Leike, Reimar; et al.. The Instruction Hierarchy: Training LLMs to Prioritize Privileged Instructions. arXiv:2404.13208 (2024). doi:10.48550/arXiv.2404.13208. PDF. ↩1
  100. [100] Mazeika, Mantas; Phan, Long; Yin, Xuwang; et al.. HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal. arXiv:2402.04249 (2024). doi:10.48550/arXiv.2402.04249. PDF. ↩1
  101. [101] Chao, Patrick; Debenedetti, Edoardo; Robey, Alexander; et al.. JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models. arXiv:2404.01318 (2024). doi:10.48550/arXiv.2404.01318. PDF. ↩1
  102. [102] Xie, Tinghao; Qi, Xiangyu; Zeng, Yi; et al.. SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal. arXiv:2406.14598 (2024). doi:10.48550/arXiv.2406.14598. PDF. ↩1
  103. [103] Feng, Zhangyin; Guo, Daya; Tang, Duyu; et al.. CodeBERT: A Pre-Trained Model for Programming and Natural Languages. arXiv:2002.08155 (2020). doi:10.48550/arXiv.2002.08155. PDF. ↩1
  104. [104] Guo, Daya; Ren, Shuo; Lu, Shuai; et al.. GraphCodeBERT: Pre-training Code Representations with Data Flow. arXiv:2009.08366 (2020). doi:10.48550/arXiv.2009.08366. PDF. ↩1
  105. [105] Wang, Yue; Wang, Weishi; Joty, Shafiq; et al.. CodeT5: Identifier-aware Unified Pre-trained Encoder-Decoder Models for Code Understanding and Generation. arXiv:2109.00859 (2021). doi:10.48550/arXiv.2109.00859. PDF. ↩1
  106. [106] Chen, Bei; Zhang, Fengji; Nguyen, Anh; et al.. CodeT: Code Generation with Generated Tests. arXiv:2207.10397 (2022). doi:10.48550/arXiv.2207.10397. PDF. ↩1
  107. [107] Fried, Daniel; Aghajanyan, Armen; Lin, Jessy; et al.. InCoder: A Generative Model for Code Infilling and Synthesis. arXiv:2204.05999 (2022). doi:10.48550/arXiv.2204.05999. PDF. ↩1
  108. [108] Xu, Frank F.; Alon, Uri; Neubig, Graham; et al.. A Systematic Evaluation of Large Language Models of Code. arXiv:2202.13169 (2022). doi:10.48550/arXiv.2202.13169. PDF. ↩1
  109. [109] Zhang, Fengji; Chen, Bei; Zhang, Yue; et al.. RepoCoder: Repository-Level Code Completion Through Iterative Retrieval and Generation. arXiv:2303.12570 (2023). doi:10.48550/arXiv.2303.12570. PDF. ↩1
  110. [110] Liu, Tianyang; Xu, Canwen; McAuley, Julian. RepoBench: Benchmarking Repository-Level Code Auto-Completion Systems. arXiv:2306.03091 (2023). doi:10.48550/arXiv.2306.03091. PDF. ↩1
  111. [111] Ding, Yangruibo; Wang, Zijian; Ahmad, Wasi Uddin; et al.. CrossCodeEval: A Diverse and Multilingual Benchmark for Cross-File Code Completion. arXiv:2310.11248 (2023). doi:10.48550/arXiv.2310.11248. PDF. ↩1
  112. [112] Lai, Yuhang; Li, Chengxi; Wang, Yiming; et al.. DS-1000: A Natural and Reliable Benchmark for Data Science Code Generation. arXiv:2211.11501 (2022). doi:10.48550/arXiv.2211.11501. PDF. ↩1
  113. [113] Hendrycks, Dan; Basart, Steven; Kadavath, Saurav; et al.. Measuring Coding Challenge Competence With APPS. arXiv:2105.09938 (2021). doi:10.48550/arXiv.2105.09938. PDF. ↩1
  114. [114] Gu, Alex; Rozière, Baptiste; Leather, Hugh; et al.. CRUXEval: A Benchmark for Code Reasoning, Understanding and Execution. arXiv:2401.03065 (2024). doi:10.48550/arXiv.2401.03065. PDF. ↩1
  115. [115] Le, Hung; Wang, Yue; Gotmare, Akhilesh Deepak; et al.. CodeRL: Mastering Code Generation through Pretrained Models and Deep Reinforcement Learning. arXiv:2207.01780 (2022). doi:10.48550/arXiv.2207.01780. PDF. ↩1
  116. [116] Chen, Xinyun; Lin, Maxwell; Schärli, Nathanael; et al.. Teaching Large Language Models to Self-Debug. arXiv:2304.05128 (2023). doi:10.48550/arXiv.2304.05128. PDF. ↩1
  117. [117] Ni, Ansong; Iyer, Srini; Radev, Dragomir; et al.. LEVER: Learning to Verify Language-to-Code Generation with Execution. arXiv:2302.08468 (2023). doi:10.48550/arXiv.2302.08468. PDF. ↩1
  118. [118] Guo, Daya; Zhu, Qihao; Yang, Dejian; et al.. DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence. arXiv:2401.14196 (2024). doi:10.48550/arXiv.2401.14196. PDF. ↩1
  119. [119] Lozhkov, Anton; Li, Raymond; Allal, Loubna Ben; et al.. StarCoder 2 and The Stack v2: The Next Generation. arXiv:2402.19173 (2024). doi:10.48550/arXiv.2402.19173. PDF. ↩1
  120. [120] Luo, Ziyang; Xu, Can; Zhao, Pu; et al.. WizardCoder: Empowering Code Large Language Models with Evol-Instruct. arXiv:2306.08568 (2023). doi:10.48550/arXiv.2306.08568. PDF. ↩1
  121. [121] Patil, Shishir G.; Zhang, Tianjun; Wang, Xin; et al.. Gorilla: Large Language Model Connected with Massive APIs. arXiv:2305.15334 (2023). doi:10.48550/arXiv.2305.15334. PDF. ↩1
  122. [122] Li, Minghao; Zhao, Yingxiu; Yu, Bowen; et al.. API-Bank: A Comprehensive Benchmark for Tool-Augmented LLMs. arXiv:2304.08244 (2023). doi:10.48550/arXiv.2304.08244. PDF. ↩1
  123. [123] Shen, Yongliang; Song, Kaitao; Tan, Xu; et al.. HuggingGPT: Solving AI Tasks with ChatGPT and its Friends in Hugging Face. arXiv:2303.17580 (2023). doi:10.48550/arXiv.2303.17580. PDF. ↩1
  124. [124] Karpas, Ehud; Abend, Omri; Belinkov, Yonatan; et al.. MRKL Systems: A modular, neuro-symbolic architecture that combines large language models, external knowledge sources and discrete reasoning. arXiv:2205.00445 (2022). doi:10.48550/arXiv.2205.00445. PDF. ↩1
  125. [125] Wang, Guanzhi; Xie, Yuqi; Jiang, Yunfan; et al.. Voyager: An Open-Ended Embodied Agent with Large Language Models. arXiv:2305.16291 (2023). doi:10.48550/arXiv.2305.16291. PDF. ↩1
  126. [126] Park, Joon Sung; O'Brien, Joseph C.; Cai, Carrie J.; et al.. Generative Agents: Interactive Simulacra of Human Behavior. arXiv:2304.03442 (2023). doi:10.48550/arXiv.2304.03442. PDF. ↩1
  127. [127] Deng, Xiang; Gu, Yu; Zheng, Boyuan; et al.. Mind2Web: Towards a Generalist Agent for the Web. arXiv:2306.06070 (2023). doi:10.48550/arXiv.2306.06070. PDF. ↩1
  128. [128] Drouin, Alexandre; Gasse, Maxime; Caccia, Massimo; et al.. WorkArena: How Capable Are Web Agents at Solving Common Knowledge Work Tasks?. arXiv:2403.07718 (2024). doi:10.48550/arXiv.2403.07718. PDF. ↩1
  129. [129] Xie, Tianbao; Zhang, Danyang; Chen, Jixuan; et al.. OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments. arXiv:2404.07972 (2024). doi:10.48550/arXiv.2404.07972. PDF. ↩1
  130. [130] Koh, Jing Yu; Lo, Robert; Jang, Lawrence; et al.. VisualWebArena: Evaluating Multimodal Agents on Realistic Visual Web Tasks. arXiv:2401.13649 (2024). doi:10.48550/arXiv.2401.13649. PDF. ↩1
  131. [131] Rawles, Christopher; Clinckemaillie, Sarah; Chang, Yifan; et al.. AndroidWorld: A Dynamic Benchmarking Environment for Autonomous Agents. arXiv:2405.14573 (2024). doi:10.48550/arXiv.2405.14573. PDF. ↩1
  132. [132] Debenedetti, Edoardo; Zhang, Jie; Balunović, Mislav; et al.. AgentDojo: A Dynamic Environment to Evaluate Prompt Injection Attacks and Defenses for LLM Agents. arXiv:2406.13352 (2024). doi:10.48550/arXiv.2406.13352. PDF. ↩1
  133. [133] Carlini, Nicholas; Tramer, Florian; Wallace, Eric; et al.. Extracting Training Data from Large Language Models. arXiv:2012.07805 (2020). doi:10.48550/arXiv.2012.07805. PDF. ↩1
  134. [134] Abadi, Martín; Chu, Andy; Goodfellow, Ian; et al.. Deep Learning with Differential Privacy. arXiv:1607.00133 (2016). doi:10.48550/arXiv.1607.00133. PDF. ↩1
  135. [135] Nadeem, Moin; Bethke, Anna; Reddy, Siva. StereoSet: Measuring stereotypical bias in pretrained language models. arXiv:2004.09456 (2020). doi:10.48550/arXiv.2004.09456. PDF. ↩1
  136. [136] Nangia, Nikita; Vania, Clara; Bhalerao, Rasika; et al.. CrowS-Pairs: A Challenge Dataset for Measuring Social Biases in Masked Language Models. arXiv:2010.00133 (2020). doi:10.48550/arXiv.2010.00133. PDF. ↩1
  137. [137] Gehman, Samuel; Gururangan, Suchin; Sap, Maarten; et al.. RealToxicityPrompts: Evaluating Neural Toxic Degeneration in Language Models. arXiv:2009.11462 (2020). doi:10.48550/arXiv.2009.11462. PDF. ↩1
  138. [138] Parrish, Alicia; Chen, Angelica; Nangia, Nikita; et al.. BBQ: A Hand-Built Bias Benchmark for Question Answering. arXiv:2110.08193 (2021). doi:10.48550/arXiv.2110.08193. PDF. ↩1
  139. [139] Kadavath, Saurav; Conerly, Tom; Askell, Amanda; et al.. Language Models (Mostly) Know What They Know. arXiv:2207.05221 (2022). doi:10.48550/arXiv.2207.05221. PDF. ↩1
  140. [140] Tian, Katherine; Mitchell, Eric; Zhou, Allan; et al.. Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback. arXiv:2305.14975 (2023). doi:10.48550/arXiv.2305.14975. PDF. ↩1
  141. [141] Band, Neil; Li, Xuechen; Ma, Tengyu; et al.. Linguistic Calibration of Long-Form Generations. arXiv:2404.00474 (2024). doi:10.48550/arXiv.2404.00474. PDF. ↩1
  142. [142] Quach, Victor; Fisch, Adam; Schuster, Tal; et al.. Conformal Language Modeling. arXiv:2306.10193 (2023). doi:10.48550/arXiv.2306.10193. PDF. ↩1
  143. [143] Geifman, Yonatan; El-Yaniv, Ran. Selective Classification for Deep Neural Networks. arXiv:1705.08500 (2017). doi:10.48550/arXiv.1705.08500. PDF. ↩1
  144. [144] Bates, Stephen; Angelopoulos, Anastasios; Lei, Lihua; et al.. Distribution-Free, Risk-Controlling Prediction Sets. arXiv:2101.02703 (2021). doi:10.48550/arXiv.2101.02703. PDF. ↩1
  145. [145] DeepSeek-AI; Guo, Daya; Yang, Dejian; et al.. DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. arXiv:2501.12948 (2025). doi:10.48550/arXiv.2501.12948. PDF. ↩1
  146. [146] Yang, An; Li, Anfeng; Yang, Baosong; et al.. Qwen3 Technical Report. arXiv:2505.09388 (2025). doi:10.48550/arXiv.2505.09388. PDF. ↩1
  147. [147] DeepSeek-AI; Liu, Aixin; Feng, Bei; et al.. DeepSeek-V3 Technical Report. arXiv:2412.19437 (2024). doi:10.48550/arXiv.2412.19437. PDF. ↩1
  148. [148] Grattafiori, Aaron; Dubey, Abhimanyu; Jauhri, Abhinav; et al.. The Llama 3 Herd of Models. arXiv:2407.21783 (2024). doi:10.48550/arXiv.2407.21783. PDF. ↩1
  149. [149] OLMo, Team; Walsh, Pete; Soldaini, Luca; et al.. 2 OLMo 2 Furious. arXiv:2501.00656 (2024). doi:10.48550/arXiv.2501.00656. PDF. ↩1
  150. [150] Qwen; :; Yang, An; et al.. Qwen2.5 Technical Report. arXiv:2412.15115 (2024). doi:10.48550/arXiv.2412.15115. PDF. ↩1