ai大模型评测/算法测试
D
Deepcoin
Internship
Remote
关于我们
我们是一支专注于多模态 AI Agent 应用的团队,正在打造下一代对话式 AI 产品。团队技术栈先进,你将与核心工程师直接合作,深度参与从模型评测到产品落地的全流程。
岗位职责
- 围绕对话式 AI Agent(文本 / 语音 / 多模态)搭建自动化测评流程,覆盖功能、性能、鲁棒性等维度。
- 设计并维护测试用例库,包括但不限于:意图识别、知识召回、长对话一致性、多轮上下文、打断与重启、噪声鲁棒性等。
- 针对端到端延迟(TTFT、首字节、首音频帧、E2E)、稳定性、资源占用等指标搭建监控与回归框架。
- 对视觉生成与音视频同步类系统进行主观与客观评测(如唇形对齐、画面流畅度、音画延迟、生成内容合规性等)。
- 复现并定位 Bug,撰写清晰的复现步骤和数据样本,与算法工程师协作推进修复。
- 跟踪行业开源评测基准与最新论文,把可复用的方法引入团队评测体系。
任职要求
- 计算机、人工智能、电子、自动化等相关专业本科及以上在读,能保证每周至少 5天到岗,连续实习 ≥ 6个月。
- Python 熟练,能独立写自动化脚本与测试框架;熟悉 pytest / asyncio / websocket / requests 任一即可。
- 了解 LLM、ASR、TTS、扩散模型中至少一类的基本原理与常见评测指标(如 CER/WER、BLEU、RTF、FID 等)。
- 对数据敏感,能从大量日志和样本中归纳模式;逻辑清晰,文字表达准确。
- 主动、自驱、能在快节奏小团队中独立推进任务。
加分项(满足任一即可)
- 有过 LLM / 对话系统 / 语音系统的评测或调优经验。
- 熟悉音视频处理工具链(ffmpeg、pydub、librosa 等)或图像质量评测方法。
- 用过 LLM-as-a-Judge、Ragas、DeepEval、lm-eval-harness 等评测框架。
- 有 Linux + GPU 服务器使用经验,会用 tmux / docker / git 协作。
- 有自己的开源项目、技术博客或 Kaggle / 评测竞赛参与经历。
我们能提供
- 接触最前沿的多模态 Agent 技术栈,参与从 0 到 1 的产品打磨。
- 直接与有丰富工程经验的 senior 工程师对接,无中间层。
- 表现优秀者优先转正 / Return Offer,或获得长期合作机会。
- 灵活的工作方式(远程)。