尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

AI测试面试真题解析:大模型、RAG与评估指标全攻略

AI测试面试真题解析:大模型、RAG与评估指标全攻略 技术面试这轮风向变得很快。前几年测试工程师面试问的是 SQL、Linux、接口自动化这两年再打开 JD很多岗位明确写着“具备 AI 应用测试经验”“熟悉大模型评估方法”“会用 AI 工具提升测试效率”优先。不是让你读论文、调模型而是要求测试工程师具备两种能力一是会测 AI 产品二是会用 AI 做测试。这篇就把 AI 测试面试里最常出现的真题整理出来附上答题方向和可落地的验证思路。你至少应该能答出 80% 的内容再去投简历。1. AI 测试面试核心能力速览先把面试官真正想考的能力拆开。AI 测试岗位面试问题的覆盖面很广但归纳下来就六个能力域。能力维度面试常见考察点代表问题AI 测试思维与传统测试的差异、测试策略变化AI 系统为什么不能用传统用例设计方法大模型应用测试Prompt、幻觉、RAG、Agent 行为测试如何测试一个基于大模型的智能客服算法模型评估分类/回归/生成类指标、评估方式F1 和 AUC 分别适合什么场景数据测试数据质量、分布漂移、标注一致性训练集和测试集分布不一致怎么发现AI 辅助测试用 AI 生成用例、脚本、缺陷分析你怎么用 AI 提升接口测试效率工程落地能力批量任务、接口调用、结果校验大模型接口返回不稳定你怎么做断言面试官的潜台词是你不仅要会点按钮还要能设计测试策略、写验证脚本、处理不确定输出。下面逐块给出真题和答题框架。2. AI 测试与传统软件测试高频差异题面试第一题往往就是这个AI 测试和传统软件测试有什么区别这类题考察的是你有没有建立正确的测试认知。传统测试的核心是“输入 - 预期输出 - 比对”。AI 系统的核心问题在于很多情况下没有唯一的预期输出。同一个 Prompt 问两次大模型可能给出不同的答案同一个图片分类模型置信度可能是 0.8也可能在下次版本变成 0.7。这种不确定性贯穿测试设计、执行、断言全流程。答题时可以从四个维度展开。2.1 测试用例设计维度传统测试用例要求可穷举等价类、边界值、判定表都是基于明确规则。AI 系统的行为由训练数据和模型参数决定无法靠人工枚举所有输入场景。对 AI 应用测试用例不只要覆盖“输入”还要覆盖数据分布、采样策略、模型版本。更稳的答题方式是把传统用例作为基础保障把“数据采样 概率分布 A/B 对比”作为 AI 测试的补充策略。2.2 结果断言维度传统接口测试断言“status_code 200”“body[0].name expected”。AI 应用返回的是自然语言或浮点数组不能直接比字符串。实际工程中常用的做法是规则校验回答是否包含关键实体、格式是否合法。语义相似度校验用 embedding 余弦相似度或者文本相似度算法。模型评估用裁判模型对回答质量打分。人工抽样对高风险场景保留人工复核。2.3 回归测试维度传统系统回归只看功能是否被破坏。AI 系统模型更新后旧的错误用例可能修复了但新的错误可能从训练数据中出现。回归测试必须包含“评估集回归”即把一份固定的评测集跑一遍观察精度、召回率、回答质量是否下降。2.4 缺陷定位维度传统缺陷能定位到代码行。AI 系统出问题可能是数据问题、特征问题、超参数问题也可能是版本兼容问题。缺陷描述时要把输入样例、模型版本、输入参数、概率分数一起记录下来方便开发反推。3. 大模型应用测试面试真题现在面试最密集的考点是大模型应用测试。以下题目必须重点准备。3.1 如何测试一个基于大模型的智能客服这个题目几乎必考。答题框架建议如下。第一层功能维度。验证基本对话能力意图识别是否准确、常见问题能否命中知识库、多轮对话上下文是否连贯、会话超时处理是否正确。第二层内容质量维度。重点关注幻觉问题。准备一份高置信度的“真题集”覆盖知识库中明确存在的问答观察模型是否给出与原文冲突的答案。还要测敏感信息用户诱导模型输出系统 Prompt、泄露隐私数据、生成违法内容。第三层业务维度。客服系统往往有完整体验链路包括转人工、工单创建、满意度评价、会话存档。需要验证 AI 无法处理时是否正确转人工会话记录是否完整。第四层稳定性与性能。并发对话、长文本上下文、上下文窗口溢出、接口超时重试。这部分答题时如果能说出“评测集”和“黄金答案集”这两个概念面试官会认为你有真实的 AI 测试经验。黄金答案集由业务专家整理的问答对作为评测基准。 评测维度正确性、完整性、相关性、安全性。3.2 RAG 系统怎么测RAG检索增强生成是目前大模型应用最主流的架构。测试 RAG 系统的关键不是只看最终回答而是要把链路拆开测。检索阶段要测查询改写是否合理、向量检索 TopK 是否返回正确文档、混合检索时关键词权重是否合理、知识库更新后检索结果是否同步生效。生成阶段要测模型是否基于检索到的上下文回答、引用的来源是否真实存在、在知识库无答案时是否能拒答而不是编造。工程上常用的做法是分阶段评估# 检索质量评估召回率与命中率 # 对每个测试问题人工标注期望命中的文档ID # 调用检索服务检查 TopK 结果中是否包含期望文档 curl -X POST http://127.0.0.1:8000/retrieve \ -H Content-Type: application/json \ -d {query: 退款多久到账, top_k: 5}返回结果里检查 document_id 列表如果期望文档不在其中说明召回有问题。这一步可以自动化为批量脚本。3.3 大模型幻觉问题怎么测面试官问幻觉问题不是让你背定义而是让你说测试方案。推荐思路分三步。第一步构造反幻觉测试集。从知识库中抽取明确的事实条目转化为问答对然后混入“知识库未覆盖的问题”看模型是否强行作答。第二步使用引用溯源。要求模型回答时返回参考来源编号。自动化校验每个答案的引用编号是否真实存在答案内容是否与引用段落一致。第三步用 LLM-as-a-Judge 做批量打分。让一个评估模型对回答的正确性、忠实性、相关性打分通过阈值判断是否属于幻觉。import requests # 调用大模型接口进行幻觉批量评估 def eval_hallucination(test_cases, api_url): results [] for case in test_cases: payload { question: case[question], context: case[context], answer: case[answer] } resp requests.post(api_url, jsonpayload, timeout30) score resp.json().get(faithfulness_score, 0) results.append({question: case[question], score: score}) return results3.4 Prompt 测试怎么做Prompt 不是只写一次就完。测试岗位要做的是 Prompt 版本管理与回归对比。核心测试维度包括指令遵循率、格式稳定性、边界输入处理、Prompt 注入防护。具体做法是维护一组固定的 Prompt 评测集修改 Prompt 后批量跑分对比指标变化而不是靠人工“感觉变好了”。Prompt 注入测试尤其要关注间接注入场景。例如用户上传一个包含恶意指令的文档让模型忽略系统指令。测试时需要用专门构造的对抗样本集验证模型是否被带偏。4. 算法模型评估指标面试题如果你面试的是偏算法测试或 AI 测试开发的岗位必然会问到评估指标。注意别只背公式要能说清楚“什么场景用什么指标”。4.1 分类模型指标指标计算方式适用场景Accuracy(TPTN) / (TPTNFPFN)类别均衡时可用PrecisionTP / (TPFP)误报代价高时关注RecallTP / (TPFN)漏报代价高时关注F12PR / (PR)同时关心精确率和召回率AUCROC 曲线下面积排序能力评估、样本不均衡举个例子应用商店的内容审核模型漏掉一条违规内容比误判一条正常内容后果严重得多所以重点看 Recall如果误判太多导致用户体验差就要配合 Precision 一起看。面试时用业务场景解释指标比纯背书更有效。from sklearn.metrics import precision_score, recall_score, f1_score y_true [0, 1, 1, 0, 1, 0, 1, 1] y_pred [0, 1, 0, 0, 1, 0, 1, 1] print(Precision:, precision_score(y_true, y_pred)) print(Recall:, recall_score(y_true, y_pred)) print(F1:, f1_score(y_true, y_pred))4.2 生成类模型指标大模型、翻译、摘要、语音识别这类生成任务输出是文本或语音序列不能简单用分类指标。面试常问的有四个BLEU基于 n-gram 精确匹配适合机器翻译但不太适合开放式对话。ROUGE基于召回率的 n-gram 重叠适合摘要评估。Perplexity衡量语言模型对文本的困惑度越低表示模型越自信但不能完全代表生成质量。Embedding 相似度把生成结果和参考答案都转成向量计算余弦相似度适合语义一致性判断。实操中直接调库评估即可from rouge_score import rouge_scorer scorer rouge_scorer.RougeScorer([rouge1, rougeL], use_stemmerTrue) scores scorer.score( 大模型测试需要关注幻觉问题, 测试大模型必须重点验证幻觉问题 ) print(scores)4.3 大模型输出评估的三种方式面试时如果被问“大模型质量怎么评估”建议把评估方式分为三层来答。第一层规则评估关键词、正则、JSON 格式校验。适合结构化输出。第二层相似度评估计算字符相似度、编辑距离、embedding 相似度。适合有标准答案的场景。第三层模型评估LLM-as-a-Judge用更强的模型对输出打分。适合开放式回答但要注意评估模型本身的偏好偏差不能盲信单一模型的分数。5. AI 辅助测试把 AI 用到测试工作里面试除了问“怎么测 AI”还会问“你怎么用 AI 做测试”。这部分回答得越具体越好不要只说“我用 ChatGPT 写脚本”。5.1 AI 生成接口测试用例实际落地中大模型生成接口测试用例的效率提升非常明显。拿一个查询接口举例先设计一个基础 Prompt 模板把接口文档片段喂给模型让它输出参数组合。prompt f 你是一个资深测试开发工程师请根据以下接口文档生成测试用例。 接口文档 {api_doc} 要求 1. 覆盖正常、异常、边界、鉴权场景 2. 用 JSON 数组返回每个元素包含 title、precondition、steps、expected 3. 不要输出多余文字 但要注意面试时一定要强调“生成结果必须经人工校验”。AI 生成的用例可能存在断言错误、覆盖盲区正式使用前需要测试人员做二次验证。你如果直接说“模型生成什么我就用什么”面试官会认为你会引入严重质量风险。5.2 用 AI 做缺陷分析与报告接口自动化跑出大量失败用例时AI 可以帮助初步归类把失败日志、请求参数、响应结果丢给大模型让它判断失败原因是环境问题、数据问题还是代码缺陷。这一步能显著减少人工排查时间在批量任务场景下很实用。输入接口返回 500错误日志堆栈 请求参数 最近一次变更记录 输出 - 可能原因参数为空导致空指针 - 建议排查查看 xx_service 第 88 行 - 风险等级高5.3 AI 辅助用例维护UI 自动化脚本最容易因页面元素变更而失效。现在很多团队用视觉模型做元素定位兜底当 XPath 失效时通过截图识别按钮位置点击。这个方向可以作为加分项回答但不要夸大如果没接触过就说“了解思路生产落地还需要考虑稳定性和成本”。6. 面试中的实战场景题这部分考察的是综合设计能力。面试官抛出一个具体场景限时让你说出测试方案。下面三个场景频率最高。6.1 场景一测试一个 AI 图像识别系统图像识别测试需要分层设计。数据层面验证训练集和测试集是否有重叠避免数据泄露导致指标虚高检查类别分布是否均衡。模型层面不同类别准确率是否存在明显差异例如背景复杂的图片是否误报率更高。接口层面图片尺寸、格式、大小限制、超时时间、并发处理能力。鲁棒性层面翻转、裁剪、亮度变化后的识别稳定性是否符合要求。6.2 场景二测试一个语音转写系统除了接口和并发语音系统还要重点测不同口音和语速的识别准确率、背景噪声干扰、专业术语是否被正确转写、长音频的截断策略、说话人分离是否正确。评估指标常用字错误率 CER 或词错误率 WER。CER (插入错误数 删除错误数 替换错误数) / 参考文本总字数6.3 场景三测试一个推荐系统推荐系统只有离线测试还不够。要设计线上 A/B 测试方案确定实验时长、样本量、评估指标点击率、转化率、人均时长。还要关注推荐多样性、同质化问题以及新用户冷启动时是否有兜底策略。答题时先分“离线评估 - 线上小流量 - 灰度放量 - 全量”四步面试官会觉得你对算法产品的工程落地有完整认知。7. AI 测试常用工具与平台如果面试官问到你用过哪些 AI 测试工具可以按分类回答。注意不要背工具名要说明工具解决什么问题。类别工具/框架用途大模型应用评估DeepEval、LangSmith、PromptfooPrompt 回归、RAG 评估、LLM 输出打分模型质量监控Evidently、WhyLabs数据漂移检测、模型效果监控自动化测试Selenium、Playwright、AppiumWeb/App 端到端测试接口测试Postman、JMeter、Requests接口功能与性能测试测试数据构造Faker、自定义脚本 大模型批量生成符合分布的测试数据AI 编程辅助GitHub Copilot、Cursor辅助写自动化测试脚本这里重点说一下 DeepEval 这类 LLM 测试框架。它的思路是内置了 AnswerRelevancy、Faithfulness、ContextualPrecision 等评估指标可以直接对 RAG 应用做自动化回归测试。这种框架值得提前跑一个 demo面试时作为项目经验讲会更有说服力。8. 面试作答逻辑与职业发展建议8.1 面试答题的通用组织方式面试官问一个 AI 测试问题时不要一上来就堆细节。建议按“定义问题 - 拆解测试维度 - 给出验证方法 - 说明评估标准”四步组织答案。以“怎么测试大模型输出的稳定性”为例定义稳定性指同一输入在相同条件下多次输出是否保持一致。拆解包含结果一致性、响应时间、格式稳定性、服务可用性。方法对同一 Prompt 重复调用 N 次统计输出变化率设置 temperature0 观察效果对响应时间做 P95/P99 统计。评估设定可接受阈值例如核心业务场景答案一致率不低于 95%。这个结构能让面试官快速抓到你回答的要点也能避免一个问题答得东一句西一句。8.2 最值得先学的三个方向如果现在还是刚开始接触 AI 测试建议按优先级补三块。第一大模型接口测试与 Prompt 评估。这是目前岗位需求最密集的方向即使你不是测大模型产品接口测试中也会频繁遇到调用大模型能力。第二RAG 应用的测试方法。大部分企业落地 AI 的方式是私有知识库问答学会分析检索、排序、生成三个环节的测试点能覆盖大多数面试场景。第三AI 辅助测试的工程化。用大模型生成测试用例、分析失败日志、维护自动化脚本。关键在于建立一条“生成 - 人工校验 - 回归 - 沉淀”的流水线而不是停留在软件操作层面。9. AI 测试面试容易踩的坑最后总结几个面试中常见的扣分点提前避开。坑一把 AI 测试等同于传统测试。全程只谈功能测试、接口测试不涉及数据质量、模型评估、概率性输出面试官会认为你还没有建立 AI 测试思维。坑二编造工具经验。没跑过的框架不要硬说用过比如没实际用过 DeepEval被追问内部机制很容易露馅。更稳的说法是“我调研过这类 LLM 评估框架了解其工作原理后续可以快速上手”。坑三忽略安全合规。AI 测试必然涉及用户数据、提示词注入、内容安全。面试时能主动提到数据脱敏、越权访问、合规红线是明显加分项。坑四不关注效果验证。面试官问你怎么判断测试有效时如果你只能回答“用例都通过了”说明缺少质量度量意识。要能说出召回率、F1、通过率、缺陷逃逸率这些量化指标。如果你准备面试建议先用上面第 3、4、5 章的问题做一次自检每题能够独立说出测试思路和至少一个验证工具再去投递 AI 测试岗位。这条赛道现在还在早期真正有系统化 AI 测试经验的人不多机会窗口还开着。
返回列表