跳到内容
当前位置:首页>面试真题>揭秘大模型测试面试|套路化考题整理

揭秘大模型测试面试|套路化考题整理

  • 2026-10-10 02:12:57
揭秘大模型测试面试|套路化考题整理
INTERVIEW · 真题拆解2026.10

面试靠背题?

面试官换题,你不换答案

六类骨架答穿全程

概念辨析 · 方案设计 · 指标度量 · 排查定位 · 边界行为

AI 测试实战

面试干货

📦 9 Parts + Conclusion

👉 滑动

PART 01

看穿套路

六类题型地图

PART 02

概念辨析

定义到边界

PART 03

方案设计

四层答题骨架

PART ///

写在最后

题目换,骨架不换

这篇只做一件事

把五花八门的面试题,归成六类能套用的骨架

“你怎么测试一个大模型应用?”

面试官一句话问出来,你脑子里唰地冒出十几个词:准确率、幻觉、RAG、提示注入、评测集……可一张嘴,全是散的。

更慌的是紧接着的第二句:“那如果评测集准确率 95%,业务还是天天投诉呢?”

你答不上来,不是因为你不会,是因为你一直在背题,而面试官一直在出题。

这篇就干一件事:把这门面试的题,归成 6 类套路。每一类给你“面试官在考什么 + 答题骨架 + 真题 + 追问链 + 弱答案对照”。看完你会发现,题目怎么换都不用慌,因为骨架是同一套。

01

PART

先看穿:为什么面试题是套路化的

WHY IT REPEATS

面试官出一道题,从来不是想听你背定义。他其实在确认三件事:

1

风险判断:你能不能一眼看出,这个系统哪个环节最容易出事。

2

证据意识:你会不会用可控对比、固定评测集说话,还是只会说“我感觉好多了”。

3

边界感:你知不知道哪一步必须留人工,哪部分你没做过也能说清怎么验证。

这三件事决定了:同一个问题,无论怎么问,答题骨架都是稳定的。

下面这张表先给你整张地图。6 类题型,每类的骨架和一眼能想起的真题:

题型
在考什么
答题骨架
典型真题
概念辨析类
你是真用过,还是只记住名词
定义 → 为什么关心 → 例子 → 边界
Token 是什么,对测试有什么影响
方案设计类
有没有分层和标准意识
分层 → 定标准 → 维度用例 → 留人工
怎么测一个 AI 客服
指标与度量类
你是看报告的,还是做分析的
质疑口径 → 归因 → 看切片 → 给行动
准确率 95% 为什么还投诉
对比选型类
能不能在同一组标准上比
同标准对比 → 场景结论 → 成本提醒
Agent 和 Chatbot 测试的区别
排查定位类
先止血还是先找根因
复现 → 缩范围 → 定性 → 止损回归
改完提示词准确率掉了
行为与边界类
你会不会诚实且有方案
承认边界 → 可行路径 → 说代价 → 下一步
没有标注数据怎么建评测集

认得这六类,你就完成了一半准备。下面逐个拆开,每类都给你能直接说出口的骨架。

02

PART

套路一:概念辨析类

CONCEPT · 你怎么理解 XX

在考什么:你是不是真的用过,还是只记住了名词。

答题骨架:一句话定义 → 工作里为什么要关心 → 一个具体例子 → 边界或常被误解的点。四步,30 秒内说完。

真题 1:Token 是什么?对测试有什么影响?

定义

Token 是模型处理文本的最小单位,不等于字,也不等于词,中文和英文的切分粒度不同。

为什么要关心

计费按 Token、上下文窗口按 Token、被截断也发生在 Token 上。

例子

验证“长文本摘要”效果差,很多时候不是模型能力不够,而是输入被截断了,后半段根本没进去。

边界

Token 数只能估算,别用字数硬换算。

注意最后一定要落到“对测试的影响”。很多候选人只解释 Token 是什么就停了——那是在考语文,不是在考测试。

真题 2:什么是幻觉?

定义

模型在缺乏依据时,仍然以很自信的语气,输出看起来合理但错误的内容。

为什么危险

它是输出质量问题里最要命的一类,因为用户会信。

例子

问一个根本不存在的接口字段,模型不报错,反而编出一段格式完全正确的说明文档。

边界

幻觉不只是“答错”,还包括编造引用、编造不存在的功能。答“把温度调低就好了”属于浅层回答。

!弱答案 🕳

“就是模型胡说八道。”

✦ 好答案

“模型在有依据和没依据时都敢答,所以我会用两类用例去覆盖——一类查溯源准不准,一类用诱导性提问看它编不编。”

真题 3:RAG 和微调有什么区别?

骨架是:它们解决的是两类不同的问题。

RAG

解决“知识不在模型里”,改的是检索链路,随时能更新知识。

微调

解决“风格、格式、指令遵循不稳定”,改的是模型参数。

所以测试重点也不同:RAG 重点测检索与溯源,微调重点测回归——用同一批评测集跑新旧版本做对比。

!弱答案 🕳

只讲成本差异。

✦ 好答案

落到“测什么不一样”。这是这道题的分水岭。

03

PART

套路二:方案设计类

DESIGN · 怎么测一个 XX

这是最高频、也最能拉开差距的一类。绝大多数人栽在这里,因为他们直接从“第一步做什么”开始答。

答题骨架(四层):

1

分层拆解:把系统拆成可测的层——入口、检索、生成、工具调用、前端。先想清楚损失会发生在哪一层。

2

定义标准:先说清“什么叫答对了”,并把它落成可判定的规则。有标准答案的看命中,没标准答案的看它会不会明确弃答。

3

维度与用例:正常路径、边界路径、滥用路径、运营路径。

4

什么留人工:明确哪些必须人来看,并说清为什么。

真题 4:怎么测一个 AI 客服?

正常路径

高频意图能不能给对答案。

歧义路径

意图不清时,会不会反问澄清,而不是硬答。

不安全路径

违规内容、辱骂、套取内部信息。

运营路径

响应延迟、限流、转人工成功率。

指标可以报:回答准确率、上下文保持率、转人工成功率、平均响应时间。

预判追问链(面试官大概率会顺着问):

→ “多轮对话怎么断言?”答:看上下文有没有被正确继承,而不是逐句比对文案。

→ “怎么衡量转人工是否合理?”答:该转没转叫漏判,不该转却转叫过度兜底,两个方向都要看。

→ “上线后怎么监控?”答:线上采样加人工抽检,重点盯兜底率突增的告警。

真题 5:怎么测一个 RAG 问答系统?

关键是分成两段测,否则出了问题你都不知道该怪谁。

检索段

该找的信息有没有被捞出来(召回);捞回来的有没有一堆噪音(精度)。

生成段

答案有没有超出检索到的内容(忠实度);有没有答非所问(相关性)。

一句话说清:检索坏了要修“找”,生成坏了要修“编”。能说出这句,面试官就知道你真调过。

!弱答案 🕳

“跑一遍看回答得对不对。”——只有一个总分,无法归因。

✦ 好答案

“检索和生成分开测,出了问题能一句话说清是哪一段坏了。”

04

PART

套路三:指标与度量类

METRICS · 数字好看业务不满

这类题面试官特别喜欢出,因为它一眼就能分出你是“看报告的人”还是“做分析的人”。

答题骨架:先质疑口径 → 再分层归因 → 看切片而不是看均值 → 最后给出行动与回归。

真题 6:评测集准确率 95%,业务投诉很多,怎么排查?

正确顺序是这样(很多人第一句就答反):

1

先确认评测集和线上分布是否一致。评测集可能是几周前从历史数据抽的,而线上用户的问法和话题早就变了。

2

再看是不是均值掩盖了长尾。95% 是平均分,那个高风险场景可能只有 60%。

3

然后分层归因:是检索没捞到(召回问题),还是生成乱编(忠实度问题)。

4

最后回头看标准:是“判对了但用户不满意”,还是“标准本身就定错了”。

!避坑 🕳

第一反应说“增加样本量”或者“调参”,基本就偏题了。面试官要的是一条完整的分析链路,不是优化手段。

真题 7:忠实度只有 0.65,怎么查?

先解释这个指标:把答案拆成一条条陈述,逐条检查有没有检索到的原文支撑。0.65 意味着大约三分之一的陈述没有依据。

常见根因,按可能性排序:

系统提示词不够硬

上下文不确定时,模型回退到自身记忆去编。

检索精度差

捞进来一堆不相关内容,模型把噪音也用上了。

召回本身不够

对的信息根本没进入上下文,模型只好“帮忙”补。

关键动作只有一个:人工抽样看 20 到 30 条低分样本,判断哪个模式占主导,再决定先改哪一层。这一步不能省,也不该用“再调调参数”代替。

说明:忠实度、相关性这类指标,业界经验参考区间大致在 0.7 到 0.8 上下,但这是经验值,不是标准差。你的业务风险越高,阈值就得定得越严,必须自己重新定。

真题 8:你说用 AI 提效了,怎么证明?

骨架

锁定单一环节 → 给前后对比 → 说明保留下来的必要人工步骤。

不要这样答

报“效率翻倍”。要说清比的是哪个环节、原来多久、现在多久、哪一步人工省不掉。

关键动作是留痕

改前改后各记一次耗时,每次改完都在同一份评测集上跑一遍分数。有这两行数字,你说的才是度量,不是体感。

只报一个好看的倍数,等于告诉面试官:你没做过可控对比——而这恰恰是本节“用指标说话”要考的。

05

PART

套路四:对比选型类

COMPARE · X 和 Y 的区别

答题骨架:在同一组标准上对比 → 按场景给结论 → 附成本与成熟度提醒。不要只列名词解释,那是搜索结果的活。

真题 9:Agent 和普通 Chatbot 的测试区别?

Chatbot

一问一答,测的是“答得对不对”。

Agent

多了工具调用、多轮记忆、任务规划、异常恢复,测的是“事办没办成”。

断言方式变了

从比对答案,变成校验结果状态——调了哪个工具、参数对不对、任务终态是不是成功。

预判追问链:

→ “Agent 调错工具怎么办?”答:校验工具选择与参数、校验失败后有没有重试或降级、校验有没有造成越权动作。

→ “多轮任务怎么断言?”答:断任务终态,不断中间话术。

真题 10:LLM-as-judge 能不能替代人工评审?

骨架是:能替代一部分,前提是你知道它在哪儿会失手。会失手的地方,至少要能点出四个:

位置偏差

成对比较时偏爱第一个选项。

长度偏差

偏爱更长的答案。

自偏好

评自家模型家族的输出会更宽松。

专业域失守

医学、法律这类领域,读着通顺但实质错误的答案会被判成对。

缓解做法:调换选项顺序取平均,抵消位置偏差;换一个不同模型家族来当裁判;先拿几百条人工标注校准裁判,再信它的分数;报告里同时给出与人工的一致率。

结论就一句:裁判是工具,不是结论。

06

PART

套路五:排查定位类

DEBUG · 线上出问题怎么定位

答题骨架:复现 → 缩小范围 → 定性(数据、模型、部署)→ 止损与回归。

面试官在这类题里看的是你的取舍速度:先止血,还是先找根因。这个先后顺序本身,就是考点。

真题 11:更新提示词之后,准确率掉了,怎么办?

1

先做可控对比:同一份固定评测集,跑旧提示词和新提示词,而不是换一批题各自跑。

2

再分段看:按任务类型切分,看是全面下降,还是某一类下降。

3

抽样人工看:是措辞问题,还是某类输入被带偏了。

4

做决策:如果掉点落在高风险场景,先回滚,再慢慢调。

一句话原则:先控制变量,再谈结论。

真题 12:线上答案突然变差,怎么查漂移?

看检索侧信号

平均相似度是不是整体下降,说“我不知道”的比例是不是突然升高。

看输入侧

线上问法的分布有没有变——冒出新话题、新句式。

看输出侧

用轻量裁判按比例采样线上真实问题,看相关性有没有掉。

这些都能做成阈值告警。要点是:别等用户投诉,用指标提前发现。

07

PART

套路六:行为与边界类

BOUNDARY · 没做过怎么办

这类题不考知识,考的是你会不会诚实且有方案。

答题骨架:承认边界 → 给可行路径 → 说清代价 → 给下一步。

真题 13:没有标注数据,怎么建评测集?

按成本从高到低给三档,并说明各自的代价:

1

领域专家标注:质量最高、最贵,适合高风险场景。

2

让强模型从你的文档里生成问题、再人工过一遍:性价比最高,是大多数团队的起点。

3

从线上真实问题里采样、补标准答案:真实度最高,但要等流量积累。

起点建议:先做 100 条“模型生成 + 人工复核”,再逐步扩到几百条。规模不必一上来就大,冻结比规模更重要——把评测集固定下来并版本化,才能把每一次改动都变成可对比的前后差。不冻结,你就永远在“感觉这版好一点”。

真题 14:AI 生成的测试用例,你敢直接用吗?

答“敢”或者“不敢”都不对。正确是:当草稿用,但有一份固定的验收动作清单。

清单就三查:查有没有需求里不存在的幻觉用例、查边界和异常有没有真覆盖到、查具体报错文案和状态码对不对。校准完才进用例库。

面试官问这道题,其实是在看你会不会“用得清楚”之后,还“知道什么时候不能用”。后者更值钱。

真题 15:多模态模型怎么测?

骨架

按模态拆 → 每一路单独定标准 → 再测跨模态一致性。

怎么覆盖

文本侧沿用前面几套;图像侧要覆盖模糊、旋转、遮挡、极端光照;跨模态要测“图文是否一致”“语音转写后再理解有没有丢信息”。

边界要主动说

多模态评测集更难标准化,多数团队会先做小规模人工基准,而不是硬套一个通用分数。

08

PART

三张速记卡

CHEAT SHEET · 面试前扫一眼

卡一

RAGAS 四指标:回答“是检索坏了还是生成坏了”

指标
它在问什么
属于哪一段
上下文召回
该找的信息,找到了吗
检索
上下文精度
找回来的,有多少是噪音
检索
忠实度
答案里的说法,有原文支持吗
生成
答案相关性
答案有没有答到问题上
生成

补一个常被提到的组合:把上下文相关性、忠实度、答案相关性三项放在一起,业界常称为“RAG 三件套”。三项都高而答案依然错,那是一个值得人工介入的硬案例。

卡二

LLM-as-judge 的四个偏差与对策

位置偏差 → 换顺序取平均;长度偏差 → 同时看短答案质量;自偏好 → 换模型家族当裁判;专业域失守 → 人工校准并报一致率。共同前提:先校准,再采信。

卡三

评测集建设三档

专家标注 / 模型生成加人工复核 / 线上采样。三档共同的底线是:冻结 + 版本化。评测集要像模型权重一样被版本管理,否则回归就没有基线。

09

PART

面试前 10 分钟:15 题自测清单

SELF CHECK · 卡壳处即短板

按这份清单自己过一遍,卡壳的地方就是你真正要补的短板。

#
题目
一句话骨架
1
Token 是什么,对测试有什么影响
定义 → 计费与窗口 → 截断案例
2
什么是幻觉
无依据也敢答 → 溯源加对抗用例
3
RAG 和微调的区别
改检索 vs 改参数 → 测什么不同
4
怎么测一个 AI 客服
四层:正常 / 歧义 / 滥用 / 运营
5
怎么测一个 RAG 系统
检索段与生成段分开测
6
准确率 95% 为何还投诉
先查分布 → 再看切片 → 归因
7
忠实度 0.65 怎么查
抽 20 到 30 条低分样本找主因
8
怎么证明 AI 提效是真的
锁环节 → 前后对比 → 说明人工
9
Agent 和 Chatbot 测试区别
断结果状态,不断话术
10
LLM-as-judge 能否替代人工
能,但要先校准并报一致率
11
改提示词后掉点怎么办
同一评测集对比 → 分段 → 回滚
12
线上答案变差怎么查
检索 / 输入 / 输出三侧信号
13
没有标注数据怎么建集
三档成本路径 + 先做 100 条
14
AI 用例敢不敢直接用
当草稿 + 三查验收清单
15
多模态怎么测
按模态拆 → 再测跨模态一致

///

LAST

写在最后

题目换,骨架不换

回到开头那两句追问。现在你会发现,第一句考的是“你会不会分层”,第二句考的是“你会不会归因”。

题目在换,骨架不变。

所以面试准备的力气,别花在背答案上,花在攒证据上。挑一个你手头的功能,把一次真实的可控对比记录成三行——改了什么、哪个指标动了、结论是什么。这三行,比背二十道题管用。

面试官真正想确认的,从来不是你会不会背框架,而是你面对一个不确定的系统时,能不能给出一个基于证据的发布判断。这套骨架,就是把这个判断说清楚的最短路径。

本文涉及的指标参考区间为业界经验值,非官方标准,实际阈值需按业务风险重新设定;文中各项数字均为演示值,非承诺指标。截至 2026-10,RAGAS 四指标与 LLM-as-judge 常见偏差仍为该领域通用描述。

既然看到这里了,如果觉得有用,随手点个赞、在看、转发三连吧。

点赞
在看
转发

THANKS FOR READING