揭秘大模型测试面试|套路化考题整理
- 2026-10-10 02:12:57
面试靠背题?
面试官换题,你不换答案
六类骨架答穿全程
概念辨析 · 方案设计 · 指标度量 · 排查定位 · 边界行为
AI 测试实战
📦 9 Parts + Conclusion
👉 滑动
PART 01
看穿套路
六类题型地图
PART 02
概念辨析
定义到边界
PART 03
方案设计
四层答题骨架
PART ///
写在最后
题目换,骨架不换
这篇只做一件事
把五花八门的面试题,归成六类能套用的骨架
“你怎么测试一个大模型应用?”
面试官一句话问出来,你脑子里唰地冒出十几个词:准确率、幻觉、RAG、提示注入、评测集……可一张嘴,全是散的。
更慌的是紧接着的第二句:“那如果评测集准确率 95%,业务还是天天投诉呢?”
你答不上来,不是因为你不会,是因为你一直在背题,而面试官一直在出题。
这篇就干一件事:把这门面试的题,归成 6 类套路。每一类给你“面试官在考什么 + 答题骨架 + 真题 + 追问链 + 弱答案对照”。看完你会发现,题目怎么换都不用慌,因为骨架是同一套。
01
PART
先看穿:为什么面试题是套路化的
WHY IT REPEATS
面试官出一道题,从来不是想听你背定义。他其实在确认三件事:
风险判断:你能不能一眼看出,这个系统哪个环节最容易出事。
证据意识:你会不会用可控对比、固定评测集说话,还是只会说“我感觉好多了”。
边界感:你知不知道哪一步必须留人工,哪部分你没做过也能说清怎么验证。
这三件事决定了:同一个问题,无论怎么问,答题骨架都是稳定的。
下面这张表先给你整张地图。6 类题型,每类的骨架和一眼能想起的真题:

认得这六类,你就完成了一半准备。下面逐个拆开,每类都给你能直接说出口的骨架。
02
PART
套路一:概念辨析类
CONCEPT · 你怎么理解 XX
在考什么:你是不是真的用过,还是只记住了名词。
答题骨架:一句话定义 → 工作里为什么要关心 → 一个具体例子 → 边界或常被误解的点。四步,30 秒内说完。
真题 1:Token 是什么?对测试有什么影响?
定义
Token 是模型处理文本的最小单位,不等于字,也不等于词,中文和英文的切分粒度不同。
为什么要关心
计费按 Token、上下文窗口按 Token、被截断也发生在 Token 上。
例子
验证“长文本摘要”效果差,很多时候不是模型能力不够,而是输入被截断了,后半段根本没进去。
边界
Token 数只能估算,别用字数硬换算。
注意最后一定要落到“对测试的影响”。很多候选人只解释 Token 是什么就停了——那是在考语文,不是在考测试。
真题 2:什么是幻觉?
定义
模型在缺乏依据时,仍然以很自信的语气,输出看起来合理但错误的内容。
为什么危险
它是输出质量问题里最要命的一类,因为用户会信。
例子
问一个根本不存在的接口字段,模型不报错,反而编出一段格式完全正确的说明文档。
边界
幻觉不只是“答错”,还包括编造引用、编造不存在的功能。答“把温度调低就好了”属于浅层回答。
!弱答案 🕳
“就是模型胡说八道。”
✦ 好答案
“模型在有依据和没依据时都敢答,所以我会用两类用例去覆盖——一类查溯源准不准,一类用诱导性提问看它编不编。”
真题 3:RAG 和微调有什么区别?
骨架是:它们解决的是两类不同的问题。
RAG
解决“知识不在模型里”,改的是检索链路,随时能更新知识。
微调
解决“风格、格式、指令遵循不稳定”,改的是模型参数。
所以测试重点也不同:RAG 重点测检索与溯源,微调重点测回归——用同一批评测集跑新旧版本做对比。
!弱答案 🕳
只讲成本差异。
✦ 好答案
落到“测什么不一样”。这是这道题的分水岭。
03
PART
套路二:方案设计类
DESIGN · 怎么测一个 XX
这是最高频、也最能拉开差距的一类。绝大多数人栽在这里,因为他们直接从“第一步做什么”开始答。
答题骨架(四层):
分层拆解:把系统拆成可测的层——入口、检索、生成、工具调用、前端。先想清楚损失会发生在哪一层。
定义标准:先说清“什么叫答对了”,并把它落成可判定的规则。有标准答案的看命中,没标准答案的看它会不会明确弃答。
维度与用例:正常路径、边界路径、滥用路径、运营路径。
什么留人工:明确哪些必须人来看,并说清为什么。

真题 4:怎么测一个 AI 客服?
正常路径
高频意图能不能给对答案。
歧义路径
意图不清时,会不会反问澄清,而不是硬答。
不安全路径
违规内容、辱骂、套取内部信息。
运营路径
响应延迟、限流、转人工成功率。
指标可以报:回答准确率、上下文保持率、转人工成功率、平均响应时间。
预判追问链(面试官大概率会顺着问):
→ “多轮对话怎么断言?”答:看上下文有没有被正确继承,而不是逐句比对文案。
→ “怎么衡量转人工是否合理?”答:该转没转叫漏判,不该转却转叫过度兜底,两个方向都要看。
→ “上线后怎么监控?”答:线上采样加人工抽检,重点盯兜底率突增的告警。
真题 5:怎么测一个 RAG 问答系统?
关键是分成两段测,否则出了问题你都不知道该怪谁。
检索段
该找的信息有没有被捞出来(召回);捞回来的有没有一堆噪音(精度)。
生成段
答案有没有超出检索到的内容(忠实度);有没有答非所问(相关性)。
一句话说清:检索坏了要修“找”,生成坏了要修“编”。能说出这句,面试官就知道你真调过。
!弱答案 🕳
“跑一遍看回答得对不对。”——只有一个总分,无法归因。
✦ 好答案
“检索和生成分开测,出了问题能一句话说清是哪一段坏了。”
04
PART
套路三:指标与度量类
METRICS · 数字好看业务不满
这类题面试官特别喜欢出,因为它一眼就能分出你是“看报告的人”还是“做分析的人”。
答题骨架:先质疑口径 → 再分层归因 → 看切片而不是看均值 → 最后给出行动与回归。
真题 6:评测集准确率 95%,业务投诉很多,怎么排查?
正确顺序是这样(很多人第一句就答反):
先确认评测集和线上分布是否一致。评测集可能是几周前从历史数据抽的,而线上用户的问法和话题早就变了。
再看是不是均值掩盖了长尾。95% 是平均分,那个高风险场景可能只有 60%。
然后分层归因:是检索没捞到(召回问题),还是生成乱编(忠实度问题)。
最后回头看标准:是“判对了但用户不满意”,还是“标准本身就定错了”。
!避坑 🕳
第一反应说“增加样本量”或者“调参”,基本就偏题了。面试官要的是一条完整的分析链路,不是优化手段。
真题 7:忠实度只有 0.65,怎么查?
先解释这个指标:把答案拆成一条条陈述,逐条检查有没有检索到的原文支撑。0.65 意味着大约三分之一的陈述没有依据。
常见根因,按可能性排序:
系统提示词不够硬
上下文不确定时,模型回退到自身记忆去编。
检索精度差
捞进来一堆不相关内容,模型把噪音也用上了。
召回本身不够
对的信息根本没进入上下文,模型只好“帮忙”补。
关键动作只有一个:人工抽样看 20 到 30 条低分样本,判断哪个模式占主导,再决定先改哪一层。这一步不能省,也不该用“再调调参数”代替。
说明:忠实度、相关性这类指标,业界经验参考区间大致在 0.7 到 0.8 上下,但这是经验值,不是标准差。你的业务风险越高,阈值就得定得越严,必须自己重新定。
真题 8:你说用 AI 提效了,怎么证明?
骨架
锁定单一环节 → 给前后对比 → 说明保留下来的必要人工步骤。
不要这样答
报“效率翻倍”。要说清比的是哪个环节、原来多久、现在多久、哪一步人工省不掉。
关键动作是留痕
改前改后各记一次耗时,每次改完都在同一份评测集上跑一遍分数。有这两行数字,你说的才是度量,不是体感。
只报一个好看的倍数,等于告诉面试官:你没做过可控对比——而这恰恰是本节“用指标说话”要考的。
05
PART
套路四:对比选型类
COMPARE · X 和 Y 的区别
答题骨架:在同一组标准上对比 → 按场景给结论 → 附成本与成熟度提醒。不要只列名词解释,那是搜索结果的活。
真题 9:Agent 和普通 Chatbot 的测试区别?
Chatbot
一问一答,测的是“答得对不对”。
Agent
多了工具调用、多轮记忆、任务规划、异常恢复,测的是“事办没办成”。
断言方式变了
从比对答案,变成校验结果状态——调了哪个工具、参数对不对、任务终态是不是成功。
预判追问链:
→ “Agent 调错工具怎么办?”答:校验工具选择与参数、校验失败后有没有重试或降级、校验有没有造成越权动作。
→ “多轮任务怎么断言?”答:断任务终态,不断中间话术。
真题 10:LLM-as-judge 能不能替代人工评审?
骨架是:能替代一部分,前提是你知道它在哪儿会失手。会失手的地方,至少要能点出四个:
位置偏差
成对比较时偏爱第一个选项。
长度偏差
偏爱更长的答案。
自偏好
评自家模型家族的输出会更宽松。
专业域失守
医学、法律这类领域,读着通顺但实质错误的答案会被判成对。
缓解做法:调换选项顺序取平均,抵消位置偏差;换一个不同模型家族来当裁判;先拿几百条人工标注校准裁判,再信它的分数;报告里同时给出与人工的一致率。
结论就一句:裁判是工具,不是结论。
06
PART
套路五:排查定位类
DEBUG · 线上出问题怎么定位
答题骨架:复现 → 缩小范围 → 定性(数据、模型、部署)→ 止损与回归。
面试官在这类题里看的是你的取舍速度:先止血,还是先找根因。这个先后顺序本身,就是考点。
真题 11:更新提示词之后,准确率掉了,怎么办?
先做可控对比:同一份固定评测集,跑旧提示词和新提示词,而不是换一批题各自跑。
再分段看:按任务类型切分,看是全面下降,还是某一类下降。
抽样人工看:是措辞问题,还是某类输入被带偏了。
做决策:如果掉点落在高风险场景,先回滚,再慢慢调。
一句话原则:先控制变量,再谈结论。
真题 12:线上答案突然变差,怎么查漂移?
看检索侧信号
平均相似度是不是整体下降,说“我不知道”的比例是不是突然升高。
看输入侧
线上问法的分布有没有变——冒出新话题、新句式。
看输出侧
用轻量裁判按比例采样线上真实问题,看相关性有没有掉。
这些都能做成阈值告警。要点是:别等用户投诉,用指标提前发现。
07
PART
套路六:行为与边界类
BOUNDARY · 没做过怎么办
这类题不考知识,考的是你会不会诚实且有方案。
答题骨架:承认边界 → 给可行路径 → 说清代价 → 给下一步。
真题 13:没有标注数据,怎么建评测集?
按成本从高到低给三档,并说明各自的代价:
领域专家标注:质量最高、最贵,适合高风险场景。
让强模型从你的文档里生成问题、再人工过一遍:性价比最高,是大多数团队的起点。
从线上真实问题里采样、补标准答案:真实度最高,但要等流量积累。
起点建议:先做 100 条“模型生成 + 人工复核”,再逐步扩到几百条。规模不必一上来就大,冻结比规模更重要——把评测集固定下来并版本化,才能把每一次改动都变成可对比的前后差。不冻结,你就永远在“感觉这版好一点”。
真题 14:AI 生成的测试用例,你敢直接用吗?
答“敢”或者“不敢”都不对。正确是:当草稿用,但有一份固定的验收动作清单。
清单就三查:查有没有需求里不存在的幻觉用例、查边界和异常有没有真覆盖到、查具体报错文案和状态码对不对。校准完才进用例库。
面试官问这道题,其实是在看你会不会“用得清楚”之后,还“知道什么时候不能用”。后者更值钱。
真题 15:多模态模型怎么测?
骨架
按模态拆 → 每一路单独定标准 → 再测跨模态一致性。
怎么覆盖
文本侧沿用前面几套;图像侧要覆盖模糊、旋转、遮挡、极端光照;跨模态要测“图文是否一致”“语音转写后再理解有没有丢信息”。
边界要主动说
多模态评测集更难标准化,多数团队会先做小规模人工基准,而不是硬套一个通用分数。
08
PART
三张速记卡
CHEAT SHEET · 面试前扫一眼
RAGAS 四指标:回答“是检索坏了还是生成坏了”
补一个常被提到的组合:把上下文相关性、忠实度、答案相关性三项放在一起,业界常称为“RAG 三件套”。三项都高而答案依然错,那是一个值得人工介入的硬案例。
LLM-as-judge 的四个偏差与对策
位置偏差 → 换顺序取平均;长度偏差 → 同时看短答案质量;自偏好 → 换模型家族当裁判;专业域失守 → 人工校准并报一致率。共同前提:先校准,再采信。
评测集建设三档
专家标注 / 模型生成加人工复核 / 线上采样。三档共同的底线是:冻结 + 版本化。评测集要像模型权重一样被版本管理,否则回归就没有基线。
09
PART
面试前 10 分钟:15 题自测清单
SELF CHECK · 卡壳处即短板
按这份清单自己过一遍,卡壳的地方就是你真正要补的短板。

///
LAST
写在最后
题目换,骨架不换
回到开头那两句追问。现在你会发现,第一句考的是“你会不会分层”,第二句考的是“你会不会归因”。
题目在换,骨架不变。
所以面试准备的力气,别花在背答案上,花在攒证据上。挑一个你手头的功能,把一次真实的可控对比记录成三行——改了什么、哪个指标动了、结论是什么。这三行,比背二十道题管用。
面试官真正想确认的,从来不是你会不会背框架,而是你面对一个不确定的系统时,能不能给出一个基于证据的发布判断。这套骨架,就是把这个判断说清楚的最短路径。
本文涉及的指标参考区间为业界经验值,非官方标准,实际阈值需按业务风险重新设定;文中各项数字均为演示值,非承诺指标。截至 2026-10,RAGAS 四指标与 LLM-as-judge 常见偏差仍为该领域通用描述。
既然看到这里了,如果觉得有用,随手点个赞、在看、转发三连吧。
THANKS FOR READING