李袖印

数据科学硕士在读,香港大学

lixiuyin2025@163.com · GitHub · IELTS 7.0

李袖印的照片

具备统计学与数据科学背景,本科辅修计算机科学与技术。主导 MeetingAgent 的全栈架构与核心开发,独立开发 WebAgent 浏览器智能体及评测框架;围绕长程执行、RAG 与记忆管理开展系统开发,并通过任务验收、异常恢复测试与失败诊断验证系统可靠性。

寻找 Agent 开发与评测方向的日常实习,可立即到岗,每周出勤 5 天,可连续实习 6 个月。现居成都,可赴全国异地实习。

项目经历

WebAgent — 多模态浏览器智能体与评测框架

面向网页检索、表单填写与跨页面操作,独立开发浏览器智能体。系统接收自然语言任务,循环读取截图与 DOM、规划步骤并调用工具,输出结果与轨迹;配套检查点恢复和独立评测,支持长程执行与结果复核。

  • 规划与执行校验:以 Planner、Tool 与 AgentHook 协议解耦规划、工具执行及生命周期扩展,支持替换规划模型;执行前校验工具参数与页面元素引用,将错误反馈给规划器限次修正,分离规划尝试与实际动作记录。
  • 观察一致性与执行约束:基于 Playwright/CDP 联合采集截图与 DOM,检查页面变化,将控件引用绑定观察批次并拒绝过期引用;依据规划器可见的页面与工具证据校验导航、下载地址来源,限制无依据操作。
  • 长程执行与恢复:以限次重规划、循环检测与原子检查点控制执行,保存进度及受支持的浏览器状态;执行前记录待完成动作,恢复时阻断结果不明的副作用操作自动重放,避免重复执行。
  • 文档解析与证据追踪:通过图注定位 PDF 图表,以质量门控的 OCR/解析级联读取文档;关联可见搜索、来源与下载记录,支持原文证据核验。
  • 评测设计与失败诊断:为网页任务定义独立终态断言,以强制中断场景验证恢复结果;对照 DOM 与工具历史定位规划偏航、状态残留及动作执行问题,结合 URL 来源、执行连续性与产物完整性约束,分别核验任务结果与过程是否符合要求。

交付与验证:固定任务集与版本开展项目内评测,两个模型在相同的 36 项任务上共通过 71/72 次执行,保留失败样本与完整执行轨迹。

评测说明

评测包含 30 项开放网页任务、5 项多域沙箱任务及 1 项 60 阶段强制中断恢复任务。分模型结果、验收条件与失败轨迹见评测报告。

查看固定版本评测报告 · 查看独立严格搜索记录

MeetingAgent — 多模态会议知识助手

主导团队会议知识助手的架构与核心开发,解决资料分散、结论难以溯源的问题。用户上传音视频或文档后,系统通过资料解析、混合检索、带引用问答与跨会话记忆,支持跨文件提问、原文核对及历史事实追溯。

  • 模块划分与任务恢复:以 FastAPI/React 贯通资料上传、处理状态与问答交互,采用模块化单体架构分离摄取、检索与生成;通过持久化任务、租约回收和有限重试支持处理恢复,数据库提交前校验租约归属,拒绝失效执行者提交变更,保留任务失败记录。
  • 层次化范围选择:并行执行文件摘要路由与正文宽召回,将片段证据聚合为文件排名,经 RRF 融合筛选资料,保护部分高排名摘要候选避免过早剔除;底层结合 Chroma 向量检索与 SQLite FTS5/BM25,逐层定位证据片段。
  • 候选分配与去重:按文件相关性与规模分配有上下限的检索预算,复用已有候选,不足时补充文件内检索,并按候选规模决定是否重排;去重时检查词项、数值与否定差异,合并重复片段时保留多个来源身份。
  • 长期记忆与历史追溯:以类型化事实管理跨会话记忆,保留冲突候选供审核,召回时核验有效状态与文档来源证据;通过不可变修订和双时态查询区分事实有效时间与系统获知时间,支持当前事实查询、历史回溯及项目/任务跟踪。
  • 引用定位与版本校验:通过 SSE 返回流式回答,将引用摘录匹配到规范化原文字符范围,关联页码、幻灯片与音视频时间戳;检查定位前后的来源版本,对匹配不唯一或版本变化返回明确状态,避免引用位置错配。
  • 分层评测与失败诊断:基于既有基准扩展验证,以 Recall@K、MRR、nDCG 评估检索与排序,使用不同于回答生成模型的评审模型并核验来源,区分检索遗漏、回答失真与引用错误;对记忆链路设置事件级检查,分别验证各环节的正确性与质量。

交付与验证:固定版本的项目内评测中,记忆写入、召回、最新值及来源关联通过 22/22 项记忆事件正确性检查。

评测说明

回答评测采用合成小样本问答集,由 GLM 生成回答、Qwen 独立评审,每例评审 3 次。各层指标分别统计,不等同于端到端质量。

查看固定版本评测报告 · 原始数据(JSON)

零样本图像分类 — 文本驱动 CNN 复现与评测

面向训练阶段未见类别的图像识别,独立使用 PyTorch 复现 Ba 等(ICCV 2015) 的文本驱动零样本 CNN,并调整、集成团队扩展模块,在 CUB/Flowers 上检验文本表示与视觉主干变化对已见及未见类别识别的影响。

  • 核心方法复现:从零实现全连接、卷积及联合三类预测器,由类别文本生成分类器权重或类别专属卷积滤波器,与冻结的 VGG-19 图像特征配合完成识别,使未见类别也能通过文本描述构造对应的分类器。
  • 复现验证与可视化:构建 CUB/Flowers 已见/未见类别评测流程,生成四组与论文对应的结果表,记录数据及评测差异;通过词语敏感性分析、最近邻检索和滤波器可视化,检查文本属性与视觉响应的对应关系。
  • 扩展设计与集成:调整并集成包含团队成员贡献的扩展模块,围绕辅助损失、文本编码与视觉主干完成 13 组实验;分别记录已见与未见类别的 ROC-AUC、PR-AUC,保留配置与结果,比较识别与迁移表现。
  • 固定配置下的结果:保持联合模型、VGG-19 与 BCE 不变,以预训练多粒度 CLIP 文本表示替换 TF-IDF,CUB 未见类别 ROC-AUC 从 0.680 提升至 0.886。

NLLB-200 中译英 — LoRA 微调

面向单卡资源下的中译英适配,独立实现 NLLB-200-distilled-1.3B 的 LoRA 监督微调流程,完成 WMT19 数据处理、训练配置、验证选模与检查点重载,形成可运行的训练与生成评估链路。

  • 参数高效微调与数据处理:在注意力和前馈投影层应用 rank-32 LoRA,结合梯度累积、混合精度与梯度裁剪完成训练;抽取 60 万对候选训练句对,仅对训练集执行质量过滤与精确句对去重。
  • 验证选模与生成复验:训练主流程按独立 2,000 对验证切片的 BLEU 选择检查点,将原始 WMT19 validation split(3,981 对)用于留出评估;重载基础模型与适配器,以 5-beam 解码和 sacreBLEU复验指定检查点。

图书馆管理系统 — 数据库设计与全栈开发

围绕读者借阅与管理员管理需求,分别完成两套课程系统:独立完成数据库技术课程的整个项目,交付 SQL Server 数据库、ER 图及项目文档;在软件工程课程团队项目中,独立承担全部前后端编码与联调,交付Flask/MySQL/Vue 2 应用。

  • 数据库建模与审计追溯:绘制 ER 图并设计 9 张 SQL Server 关系表,以主外键及 CHECK/UNIQUE 约束限定实体关系与合法取值;关键审计记录不设置指向读者、管理员的外键,以触发器限制更新与删除,避免删除业务对象时连带丢失记录,保留操作追溯依据。
  • 借阅规则与批量结算:以 7 个触发器和 26 个存储过程实现借阅上限、应还日期及逾期结算等功能;对批量归还产生的逾期记录按读者汇总罚款,检查余额后,在事务中更新余额并逐笔写入扣款流水,异常时回滚相关变更。
  • 全栈开发与访问控制:Web 系统交付 30 个接口,其中 24 个使用 JWT 保护;结合登录身份限制普通读者查询他人记录,管理员可按权限指定用户。借还书流程先暂存图书状态与借阅记录变更,再统一提交多表操作,异常时回滚相关变更。

EM/MCEM 参数估计 — 算法实现与模拟验证

针对误差中较大的极端值及同组观测之间的相关性,分别采用 Student's t 回归与线性混合模型;推导并以 R 实现 EM/MCEM 参数估计,串联隐变量建模、迭代求解、模拟实验与参考实现对照,检验估计结果和收敛行为。

  • 算法推导与实现:推导隐变量后验与迭代更新,分别实现解析期望和蒙特卡洛近似;明确区分 MAP、ML 与 REML 估计目标,记录参数及目标函数的迭代轨迹。
  • 模拟验证与数值核验:在统一数据生成设置与固定初值下对照 EM 与不同采样量的 MCEM,分析估计误差与收敛表现;分别与 optimlme4nlme 核验对应模型的估计结果,保留对照报告与可复验脚本。

文本分类架构对照 — CNN、BiLSTM 与 Transformer

面向影评情感识别与新闻主题分类,独立实现 CNN、BiLSTM 与 Transformer,搭建文本清洗、训练、验证选模及测试流程;在四个数据集上比较分类准确率与计算吞吐,为不同任务的模型选择提供依据。

  • 三类分类架构实现:以 PyTorch 实现多尺度残差 CNN、双向 LSTM 与带位置编码的 Transformer,分别提取局部模式、双向序列信息与自注意力表示,并分析三类结构的计算复杂度。
  • 受控实验与数据隔离:统一数据划分、训练协议和 GloVe-300d 初始化的可训练词嵌入,在 IMDB、AG News、BBC News 与 SST-5 上评估;词表仅由训练集构建,避免词表构建引入测试集信息。
  • 分类准确率对照:在保留的固定配置实验中,固定随机种子比较 12 个模型—数据集组合,CNN 在 IMDB、BBC News 与 SST-5 上分别取得 88.5%、97.3% 和 42.4% 的测试准确率,在三种被比较模型中最高或并列最高。
  • 前向吞吐量评估:在 RTX 5090、batch=512 的统一设置下测量三类模型的前向吞吐量,CNN 在四个数据集上均为最高;该结果反映固定硬件与批量下的计算吞吐,不等同于端到端服务延迟。

ViT Image-to-LaTeX — 数学表达式识别

面向印刷体与手写公式图像转 LaTeX,独立设计并从零训练纯 Transformer 编码器—解码器,完成训练故障诊断,并对照词元预测与自回归生成结果,识别两类任务上的性能差距及训练指标的局限。

  • 端到端生成架构:构建约 773 万参数的 ViT 编码器—Transformer 解码器,不依赖 CNN 主干或语法约束,分别使用 50,000 条印刷体公式和 50,000 条手写公式从零训练各自的识别模型。
  • 训练故障诊断与修复:定位学习率预热峰值附近的优化崩溃,通过全局范数 1.0 的梯度裁剪和 800 步 Transformer 预热计划,使两个数据集上的训练保持稳定,限制异常梯度对参数更新的影响。
  • 生成质量与失败分析:对照 teacher-forcing 词元准确率与自回归生成表现,识别逐词预测和完整公式输出的差距;在两个数据集各 500 个测试样本上,四束搜索经平滑后的平均句级 BLEU-4 分别为 0.701、0.079,定位手写体生成的误差,比较两类数据的表现差距。

有向社交网络的正影响力最大化(Java)

面向种子数量受限时的正向传播优化,独立以 Java 实现有符号独立级联模型的种子选择与仿真评估流程,对照贪心策略和基于节点度的启发式方法,涵盖正负关系建模、随机扩散模拟与并行候选搜索。

  • 贪心选种与并行仿真:以蒙特卡洛估计边际增益,逐轮选择种子,并通过线程池与并行流执行候选评估和扩散模拟;在含 10,966 个节点、44,356 条有向边的网络中选择 10 个种子。
  • 基线对照与影响力评估:在相同种子数量下,已记录的 100,000 次仿真复核中,贪心种子集的平均正向影响节点数为 167,较出度与正出度两种基线(均为 149)提升约 12.1%。

CIFAR-100 图像分类

面向单卡资源约束下的 100 类图像识别,独立实现基于 WideResNet 的分类流水线,结合类别感知增强与训练优化,并在留出测试集上评估分类表现,重点处理小尺寸图像的类别差异与训练样本多样性。

  • 模型与训练策略:实现 pre-activation WideResNet-28-10,以难度与超类感知增强适配类别差异,结合 MixUp/CutMix 增加样本组合;通过混合精度控制训练开销,采用 EMA 与预热—余弦学习率调度完成训练。
  • 资源约束与留出评测:单次记录运行在一张 16 GB GPU 上约 2.5 小时完成训练与评测,在含 10,000 张图像的 CIFAR-100 官方测试集上取得 0.832 macro-F1。

专业技能

关注方向

研究阅读与技术跟进:通过论文阅读、开源代码学习与笔记整理,关注以下技术问题。

教育背景

香港大学

数据科学硕士在读(GPA 3.51,前 30%)

山东大学

统计学理学学士(均分 86.52,前 30%)
计算机科学与技术辅修(均分 88.86)

助教经历:2024年9月–2025年6月,担任数学分析 I、偏微分方程课程助教,负责作业批改与答疑、偏微分方程课件中译英及 LaTeX 排版。

荣誉:山东大学优秀毕业生|全国大学生数学建模竞赛山东赛区一等奖