M.ENG. CANDIDATE · LARGE LANGUAGE MODELS
Ma Yi
哈尔滨工业大学(深圳) · 电子信息(计算机技术)
现为哈尔滨工业大学(深圳)硕士研究生,研究聚焦于复杂推理场景下大语言模型的知识获取、决策优化与可靠评估。主要研究兴趣包括 Agentic RAG、大模型强化学习后训练、LLM4Rec 与数据集蒸馏。
当前工作围绕多步检索轨迹建模、过程奖励设计与策略优化展开,旨在通过监督微调、偏好学习和在线强化学习,提高智能体在开放域问答与真实业务任务中的稳定性、可控性和可解释性。
NEWS
最新动态
SELECTED RESEARCH
论文与研究
01
IEEE TRANSACTIONS ON MULTIMEDIA · CCF-A
D3M:基于扩散模型的原型表示数据集蒸馏
针对大规模图像数据训练成本高与传统蒸馏方法跨架构泛化不足的问题,在扩散模型潜空间中构造兼具代表性与多样性的原型表示,并通过加噪与去噪过程生成高信息密度的蒸馏图像。在 16% 压缩率下达到原始数据训练效果的 91%,相较对比方法平均提升约 4%。
02
IEEE TRANSACTIONS ON CIRCUITS AND SYSTEMS FOR VIDEO TECHNOLOGY · ACCEPTED
Robust Dataset Pruning via Joint Noise-Aware Discrimination and Re-Labeling
针对标签噪声场景下数据集剪枝难以区分困难样本与错标样本的问题,提出两阶段 Robust Pruning(RoP)框架:结合标签分布差异、特征与标签传播识别噪声样本,并对保留子集重新标注,以降低模型对噪声标签的过拟合。
研究方向
EXPERIENCE
实习经历
字节跳动
大模型算法实习生 · Data · 抖音 · 内容技术
- 面向推荐系统的用户仿真与归因需求,融合用户画像、多尺度兴趣与历史行为序列,构建基于 Qwen 系列模型的 LLM4Rec 训练与推理框架。
- 完成大规模用户数据处理、模型选型和消融实验;4B 模型达到 ACC 0.764、AUC 0.789,相较基线提升 20 余个百分点。
- 构建结构化监督数据与多裁判 Rubric 评估体系,结合 SFT、RFT、DPO 与 GRPO 优化归因解释质量。
智谱 AI
大模型算法实习生 · 华南交付
- 负责财务表格智能问答模块的算法选型与优化,系统比较直接推理、工具调用与代码解释器等方案。
- 设计受约束代码生成与执行的两阶段流程,并建立 bad case 分析、提示策略与后处理规则的迭代闭环。
- 优化方案在真实用户数据上达到 100% 准确率,相较基线提升 53%,并通过评审进入生产环境。
EDUCATION & HONORS
教育背景与荣誉
2024.08 – 2027.06
哈尔滨工业大学(深圳)
电子信息(计算机技术) · 硕士
研究方向:RAG、Agentic RL 与数据集蒸馏;专业排名前 15%,获学业一等奖学金。
2020.09 – 2024.06
哈尔滨工业大学(深圳)
计算机科学与技术 · 本科
系统学习数据结构、计算机系统、数据库、高级算法与机器学习;专业排名前 15%,获学业一等奖学金。
全国大学生数学建模竞赛 · 广东省三等奖
多次获得校级一、二等奖学金
TECHNICAL PROFILE
技术能力
- Research
- Agentic RAG、LLM 后训练、强化学习、数据集蒸馏、LLM4Rec
- Training
- PyTorch、Llama-Factory、ms-swift、LoRA / PEFT、DeepSpeed、Megatron
- Inference
- vLLM、结构化生成、工具调用、代码解释器、检索与重排
- Engineering
- Python、C、Linux、大规模数据处理、分布式训练与实验评估