- 日期:2026-04-24
- 企业与岗位:待核验|测试开发
- 适用层级:初级—中级
内容说明
本篇为社区对用户分享面经的整理汇编,旨在帮助求职者了解面试考察方向。问题部分力求忠实还原原帖问答脉络;「参考答案 / 复盘思路」为整理方结合工程实践原创补充,仅供交流参考,不代表官方标准答案。
原汇编中企业名称存在不一致,本文暂不确认面试企业;面试题以所链接的公开汇编为依据。
一、原面经涉及的面试问题(8项)
1. 你怎么理解测试开发岗位?
参考答案 / 复盘思路: 测试开发不仅是编写自动化脚本,更是为质量保障提供可复用的工程能力。可以从风险识别、测试设计、自动化执行、数据构造、CI集成、质量度量和发布门禁七个方面理解岗位。回答时最好结合一个具体项目:人工回归耗时长,于是把稳定的接口规则下沉到pytest回归,并建立失败日志与质量报告,最终让团队更快判断能否发布。要解释为什么某些场景仍需探索性人工测试;强调自动化数量不是唯一指标,重要的是缺陷检出能力与维护成本。
2. AI Agent与ChatGPT这种大模型有什么区别?
参考答案 / 复盘思路: 大语言模型主要提供理解、生成和推理能力,Agent则在此基础上组织目标、状态与工具调用,以便完成多步骤任务。两者并非完全并列概念,Agent通常需要某种模型或规则引擎参与决策。比如用户要求查询订单并申请退款,模型可以解释政策,Agent还需查订单、验证身份、提交请求并确认结果。测试Agent不能只核对回答是否合理,还要查工具是否正确、状态是否更新、有无权限越界和失败补偿。并非所有问题都适合Agent,固定流程有时更稳定、可控。
3. 大模型为什么产生幻觉,如何降低幻觉?
参考答案 / 复盘思路: 幻觉常见于模型生成与可靠证据脱节:训练知识过期、问题含糊、上下文缺失,或模型把检索错误总结成肯定结论。降低风险可以从业务流程设计入手:对事实问答提供可追溯检索证据、要求引用、在证据不足时允许拒答,对敏感操作使用规则校验和人工确认。测试要把“正确回答、无依据编造、应拒答却编造、证据存在但引用错误”分开记录,并对不同业务风险赋权。RAG并不能自动消除幻觉,错误检索与错误归纳仍会发生。
4. RAG的工作过程是什么?
参考答案 / 复盘思路: 典型RAG流程是文档采集与清洗、切分、向量化或建立关键词索引、查询检索、重排、上下文组装,最后让模型依据证据生成答案。分块过小可能丢失上下文,过大又浪费上下文窗口;检索命中率高也不保证最后回答忠实。测试时应分层验收:文档更新是否及时、召回是否包含正确片段、重排是否把关键证据排前、引用是否能对应回答、无答案时是否合理拒答。还要注意权限过滤,不能让用户通过RAG检索到无权限文档。
5. 大模型推理过程太长,如何优化?
参考答案 / 复盘思路: 先确认所谓“推理太长”指用户可感知延迟、生成token数还是Agent链路总耗时。用Trace拆解检索、模型首token、工具调用、重试和后处理各阶段耗时,再针对瓶颈优化:缩减无关上下文、缓存稳定结果、并行独立检索、设置预算与提前终止策略,或采用大小模型路由。评估不能只看速度,必须在固定任务集对比任务成功率、事实正确性和成本;如果减少思考步骤导致复杂任务失败,优化未必划算。
6. TCP与UDP有什么区别,视频直播使用哪种协议?
参考答案 / 复盘思路: TCP提供面向连接的可靠有序字节流,UDP本身不保证送达和顺序,但协议开销小、可由上层自行控制延迟与可靠性。实时直播不应该简单回答“永远用UDP”:媒体传输可能使用RTP/UDP,也可能因网络条件使用TCP或基于QUIC的协议,实际取决于产品架构。测试重点包括丢包、乱序、抖动、带宽受限、切换网络及缓冲策略,并观察端到端延迟、卡顿、音画同步和恢复时间。协议选择最终是实时性与可靠性的工程权衡。
7. JVM垃圾回收机制是什么?
参考答案 / 复盘思路: JVM垃圾回收旨在回收不再可达的对象,不等于程序不会内存泄漏。可以简述对象可达性分析、年轻代对象回收与不同收集器的停顿和吞吐取舍,但不要把某一种GC策略误说成所有JDK的默认方案。排查性能时看堆使用曲线、GC频率、暂停时间、对象分配速率和Full GC原因;若GC后堆占用持续上升,再通过堆转储分析对象引用链。测试可通过稳定负载、峰值负载和长期运行验证延迟与内存趋势,而不是只看程序是否OOM。
8. Python 2与Python 3有哪些区别?
参考答案 / 复盘思路: Python 3与Python 2在字符串、整数除法、print语法、迭代器行为和标准库方面存在差异;Python 2早已结束官方维护,新项目通常不应以其作为首选。面试时建议以测试脚本迁移为例:Python 3的str是Unicode文本,bytes需要明确编解码,接口响应与日志处理如果混用会触发错误;除法/和//也需要注意语义。迁移时用自动化测试覆盖文本、编码、依赖库和运行环境,而不是机械套用语法转换工具。
延伸思考(社区补充)
某个RAG问答系统升级后,回答的幻觉率下降了,但对能够正确回答的问题也更频繁拒答。测试团队怎样判断这次升级是否真正改善了产品质量?
思考方向: 可在固定基准集上分别评估忠实性、有效回答率、误拒答率和关键业务任务成功率,不宜只看幻觉率。
