【面试题】测开/AI测试方向面试题

发布时间:2026/10/9 15:31:27
【面试题】测开/AI测试方向面试题 1. 百度搜索、网盘下载或者登录功能你会怎么设计测试登录模块功能正常账号密码登录、验证码登录、短信登录错误密码、账号不存在、验证码过期/错误记住密码、自动登录单点登录多端互踢。边界密码超长/特殊字符账号锁定策略异地登录触发风控。安全SQL注入、密码明文传输、csrf、cookie劫持。兼容不同浏览器/移动端。性能高并发登录、登录接口响应。异常网络中途断开弱网重试。百度搜索功能关键词搜索、空搜索、特殊符号、长文本联想下拉分页筛选时间/类型无结果场景。边界极短关键词、超长query、敏感词同音错别字。性能搜索响应时间并发搜索。UI结果排版、图片加载。异常网络抖动搜索超时。网盘下载功能单文件下载、批量下载大文件、小文件已分享文件/私有文件断点续传。权限无权限下载、文件已过期、文件被删除。弱网网络中断后恢复是否继续断点限速场景。性能大文件下载速度并发下载。异常磁盘满、存储空间不足。设计思路功能 边界 权限 异常 弱网 性能 安全2. 一个接口突然从100ms变成2秒你怎么定位先确认基础信息是不是全量用户变慢还是特定参数/特定地域有没有报错QPS有没有上涨看链路监控全链路Trace看耗时到底耗在哪一层网关/应用/MySQL/Redis/外部依赖。如果耗在数据库查看慢查询日志explain看执行计划确认索引失效、回表、锁等待、事务过长。如果耗在Redis看Redis命令耗时、大key、网络带宽、缓存击穿/雪崩。如果耗在第三方调用下游接口超时同步等待拖慢。应用侧GC频繁、线程池打满、锁竞争。网络带宽、丢包、DNS解析。复现线上抓请求参数测试环境复现对比基准。排查顺序监控告警 → Trace链路定位耗时节点 → 日志查看异常 → 数据库/中间件分析 → 本地复现3. MySQL 索引为什么能提升查询性能索引本质是B树把无序数据变成有序。没有索引全表扫描逐行比较IO次数多。B树树高度很低叶子节点有序链表查询只需要几次磁盘IO快速定位数据。覆盖索引直接从索引拿到全部字段不需要回表进一步减少IO。注意索引不是越多越好会降低写入性能新增/更新要维护B树。4. Redis缓存和数据库不一致怎么办怎么测试常见方案更新数据库 删除缓存推荐读的时候重新加载缓存。延迟双删更新DB前删缓存更新DB后等待一小段时间再删一次减少短时间脏读。队列异步更新缓存或者监听binlog同步更新缓存Canal。无法做到绝对强一致只能保证最终一致性。测试方法并发读写压测大量线程同时更新DB读缓存校验缓存值和数据库是否一致。制造极端时序更新DB成功但删缓存失败验证脏数据是否出现。缓存过期场景缓存过期读取是否自动加载最新数据。故障注入删缓存的时候网络异常、服务宕机。长时间巡检定时比对缓存和数据库数据统计不一致率。5. MQ 出现重复消费、消息积压怎么验证重复消费验证构造重复投递手动重发消息模拟消费者处理完消息还没提交offset就宕机。校验幂等同一个消息多次投递业务不能重复生效唯一业务ID做幂等。日志埋点统计消息处理次数看是否多次执行。消息积压验证压测生产者发送速率 消费者消费速率。监控看消息堆积数量、消费延迟。验证扩容增加消费者实例后堆积是否下降。极端场景消费者服务宕机大量消息堆积恢复后能否消费完成不丢消息、不乱序。边界消息过期、死信队列是否正常。6. UI 自动化元素经常定位失败框架层怎么解决优先使用稳定定位器减少xpath绝对路径优先data-testid业务埋点测试属性。统一封装等待框架层封装显式等待不要写固定sleep。元素重试机制框架增加自动重试装饰器元素找不到自动重试N次。自动截图定位失败自动截图页面源码方便排查。处理动态场景iframe、弹窗、新窗口、动画加载完成检测。页面状态校验等待页面loading遮罩消失再操作元素。失败分类区分临时不稳定flaky和真bugflaky case单独标记不阻塞流水线。隔离用PO模式元素定位统一放在Page对象定位修改只改一处。7. 大模型测试和普通接口测试最大的区别是什么普通服务接口确定性输出相同入参返回固定结果断言可以精确匹配返回值。大模型概率性输出相同输入多次返回不一样没有唯一标准答案。普通接口重点测报错、参数校验、数据库逻辑、响应码。大模型重点测事实正确性、幻觉、意图理解、有用性很难硬编码断言多用LLM-as-Judge、人工评测。一句话总结传统接口测“逻辑是否正确执行”大模型测输出内容质量与事实可靠性。8. RAG 怎么设计评测集检索和生成分别怎么评估RAG评测集设计分为4类样本知识库存在答案正常查询预期召回正确文档生成正确答案。知识库无答案模型不能编造应该回答不知道反幻觉样本。歧义Query用户描述模糊。干扰样本知识库内有相似冲突文档容易召回错误片段。字段query、golden_answer、expected_retrieval_doc、difficulty、label。检索层评估召回阶段指标召回准确率、召回率、MRR、NDCG。判断TopN文档是否包含正确参考文档。生成层评估事实正确性回答内容是否和参考文档一致不能编造。忠实度所有结论都来自检索文档。有用性是否回答用户问题。手段人工标注 LLM-as-Judge打分。9. LLM-as-a-Judge 怎么设计怎么验证 Judge 自己靠不靠谱Judge设计要点Prompt固定角色、明确打分维度、1~5分清晰分级标准。Few-shot注入几条标注好样例稳定打分倾向。输出结构化结果思考过程 分数 理由。增加自校验让Judge检查回答和参考文档是否冲突。Judge可靠性验证非常重要面试高频Golden 标定集人工标注一批样本Judge打分和人工打分对比计算相关性Pearson相关系数。自一致性测试同一条样本多次让Judge打分看分数波动大小波动大代表Judge不稳定。对抗样本测试输入容易迷惑模型的幻觉样本看Judge能不能识别错误。盲测调换正确/错误答案测试Judge是否依然能正确区分好坏。校准如果Judge打分普遍偏高/偏低调整Prompt或者权重。10. Agent 怎么测试 Tool / Skill 选择是否正确分层测试单元评测集工具选择测试集构造大量query应该选工具A、选B、多选工具、不需要工具、缺少参数。指标工具选择命中率、参数提取准确率。边界case需求超出所有Skill能力验证Agent不强行调用工具。端到端评测完整Trace记录看整个思考工具调用链路。LLM-as-JudgeJudge评审Agent的工具调用序列是否合理。错误归类选错工具、多余调用、漏调用、参数提取错误。11. Agent 执行到一半失败状态恢复和重试怎么测测试场景Agent执行中途中断服务crash、超时重启后通过Checkpointer恢复State继续完成任务。Skill调用失败重试区分可重试错误网络超时和不可重试错误参数非法不可重试不能无限重试。断点校验恢复后的State和中断前一致历史思考记录、工具调用记录完整。幂等验证重试Skill不能造成重复业务操作比如重复下单。极端场景刚好在保存Checkpoint之前宕机测试会不会丢失状态或者重复执行。状态污染重试恢复后旧状态会不会干扰后续步骤。指标断点恢复成功率、重试幂等性。12. Python / Java、SQL、Linux 和常见算法题能不能现场写出来面试口述回答可以现场手写基础代码。Python常用pytest、装饰器、生成器、闭包requests简单mock多线程协程文件处理。Java基础集合HashMap、线程、简单接口单元测试Junit。SQL多表join、group by、order by、子查询、索引explain慢SQL优化。Linux常用命令awk/sed/grep、进程、端口、日志排查。算法链表反转、二分查找、冒泡/快排、两数之和、滑动窗口这些基础算法可以手写。复杂工程级算法现场写会有疏漏但思路可以完整讲清楚。

关于本文作者

来自尧图内容编辑团队

尧图内容编辑团队 内容团队

尧图内容编辑团队

本文由尧图网络内容编辑团队执笔。团队由资深项目经理、前端工程师与设计师组成,所有内容均来自亲手交付的真实项目,先讲清问题、再给出可落地的解法。尧图深耕北京网站建设十年,服务过京华建材集团、智造科技等各行业客户,把一线经验沉淀为可复用的行业观察。

  • 十年建站经验,覆盖建材、制造、服务、文创等
  • 项目经理把关选题与事实准确性
  • 工程师与设计师联合撰写专业细节
  • 统一编辑规范,保证文风与排版一致
  • 每月复盘转化数据,迭代选题方向

延伸阅读

相关资讯与近期热门内容

深度阅读推荐

建站决策前值得细读的三篇

网站改版的5个关键决策
2024-08-12

网站改版的5个关键决策

什么时候该改版、改到什么程度、如何避免流量掉光,京华建材集团改版复盘给出答案。

获取专属建站方案

看完文章,把您的行业与预算告诉我们,免费获取一份量身定制的官网建设方案与报价。

立即免费咨询