项目
我构建的研究系统、基础模型评估,以及已上线的 AI 产品。
论文与项目正文为英文,此处的标题与摘要为中文翻译。
- 2026/进行中
Doover:一款 AI 照片艺术应用,从第一次提交到 App Store 上线只用了十天
Doover: an AI photo-art app, from first commit to the App Store in ten days
iOS 上的 AI 照片艺术应用:15 个手写视觉技能与 41 种风格,由 gpt-image-2 渲染,配合端侧 Core Image 调色流程。独立完成 SwiftUI 客户端、Next.js 后端、AWS 异步渲染队列与 App Store 发布,263 次提交。
正文为英文 - 2025/进行中
RallyAI:运行在 iPhone、Apple Watch 与微信上的端侧 AI 网球教练
RallyAI: an on-device AI tennis coach for iPhone, Apple Watch and WeChat
把网球视频分析放进口袋:九个 Core ML 模型在 iPhone 神经引擎上完成挥拍识别、球速估计、落点判定与技术评分,视频不离开手机。独立构建 iOS 与 Apple Watch 应用、微信小程序与 H5 客户端、AI 教练 Lio、投影训练模式与蓝牙发球机控制。
正文为英文 - 2026/已完成
DNA 基础模型并不可以相互替代:一份实用的选型指南
DNA Foundation Models Are Not Interchangeable: A Practical Routing Guide
梳理 40 个基因组模型并实测其中三个,说明训练目标、上下文长度、输出形式与运行成本如何决定某个模型是否适合特定的基因组学任务。
正文为英文 - 2026/已完成
超越后果标签:队列规模的序列到功能变异解读
Beyond Consequence Labels: Cohort-Scale Sequence-to-Function Interpretation
使用 AlphaGenome 与 Enigma 双模型流程,为常规高/中等后果标签所遗漏的变异补充功能学证据,在保留临床边界的前提下扩大可复核的变异范围。
正文为英文 - 2026/已完成
让序列到功能模型读懂结构变异
Teaching Sequence-to-Function Models to Read Structural Variants
将缺失、重复、倒位、断裂端与基因融合编码为配对的 REF/ALT DNA 窗口,系统评估序列到功能模型对结构变异的解读能力。
正文为英文 - 2026/已完成
当序列不足以说明问题:FFPE 假阳性风险建模
When Sequence Is Not Enough: Modeling FFPE Artifact Risk
在公开多检出器数据与去标识化的配对新鲜冷冻/FFPE 队列上进行分组留出验证,结果表明读段层面的技术证据(而非 DNA 序列本身)才是关键信号。
正文为英文 - 2026/已完成
构建 OncoS2F:一个受治理约束的基因组基础模型智能体
Building OncoS2F: A Governed Agent for Genomic Foundation Models
一个全栈生物医学 AI 智能体,在 13 种基因组模型配置、23 个受治理工具包与 15 项工作流技能之间进行调度,并强制执行计划审批、来源追溯与研究用途边界。
正文为英文 - 2026/已完成
冻结的病理基础模型已经知道什么
What a Frozen Pathology Encoder Already Knows
基于 2,099 张公开 TCGA 全切片图像的基准测试表明:冻结的病理基础模型加均值池化与线性分类头,即可从 H&E 图像中还原受体状态与 HRD。更复杂的可学习注意力聚合器并未超越这一简单基线:它把几乎全部权重压在约 10% 的图块上,却没有换来任何准确率提升。
正文为英文 - 2025/已完成
AlphaGenome 能预测心房颤动的 TWAS 变异效应吗?
Can AlphaGenome Predict TWAS Variant Effects in Atrial Fibrillation?
在 10 个 GTEx 组织中将 AlphaGenome 的预计算变异效应分数与 TWAS 关联结果比较,发现方向性信号微弱但真实,并揭示基于序列的表达预测的固有局限。
正文为英文 - 2025/已完成
图神经网络在空间转录组学中的应用导论
Introduction of Graph Neural Networks for Spatial Transcriptomics
从基础概念到前沿研究实现,系统介绍如何理解并将图神经网络应用于空间转录组数据。
正文为英文 - 2025/已完成
跨组织空间转录组数据(MOSTA)上的自监督学习方法评估
Self-Supervised Learning Methods on Cross-tissue Spatial Transcriptomics Data (MOSTA)
在大规模小鼠胚胎空间转录组数据上评估 8 种自监督方法与 3 种图神经网络架构的组合,发现基于重构的方法表现出值得注意的效果。
正文为英文 - 2025/已完成
空间转录组数据(SiT)上自监督学习方法的系统比较
Comparing Self-Supervised Learning Methods for Spatial Transcriptomics Data (SiT)
在小鼠脑部空间转录组数据上,对 8 种自监督学习方法与 3 种图神经网络架构进行系统评估。
正文为英文 - 2025/已完成
从零构建一个 ChatGPT:深入大语言模型训练全流程
Building a ChatGPT from Scratch: A Dive into LLM Training
完整走通分词、预训练、分布式训练与微调流程,在 112 亿 token 上训练一个 5.61 亿参数的对话模型,以理解现代语言模型的各个环节。
正文为英文 - 2025/已完成
自监督学习方法综述
Self-Supervised Learning Methods
梳理 SimCLR、BYOL、SimSiam、Barlow Twins、DINO 等现代自监督学习方法,并给出其数学基础与互信息理论视角。
正文为英文 - 2025/进行中
个人网站项目
Personal Website Project
就是这个网站——一个研究作品集,包含一个有据可依的 AI 助手、一套本地检索索引,以及一套刻意不打扰阅读的动效系统。
正文为英文