一、方向概况与选拔要点
复旦大学统计机器学习方向依托复旦大学管理学院统计与数据科学系、复旦大学大数据学院、复旦大学计算机科学技术学院、复旦大学数学科学学院,联合上海市统计与数据科学重点实验室、教育部"统计与数据科学"拔尖学生培养基地、上海数学中心(国家应用数学中心分中心)、上海市人工智能实验室联合培养基地、中国人工智能学会机器学习专委会常务理事单位、中国统计教育学会大数据与统计教学专委会、《机器学习》(journal of machine learning research,jmlr)中国编委联络站、国际机器学习大会(neurips/icml/iclr)中国学术联络点等核心载体,是由复旦大学自1980年代即在数理统计与模式识别领域奠基深耕,2015年大数据学院成立后正式将"统计机器学习"确立为独立核心方向,2020年进一步整合人工智能、深度学习理论、优化算法资源,形成的国内将"统计学习理论—优化算法设计—深度学习基础—生成模型—因果机器学习—联邦与隐私保护学习—强化学习—行业智能应用"八维一体建设的学科高地。该方向整合统计学、数学、计算机科学、信息论、最优化理论、人工智能、生物信息学、金融工程等多学科资源,聚焦"模型假设—损失函数设计—正则化策略—优化求解—泛化理论—不确定性量化—可解释性—公平性约束—部署推断"全链条机器学习逻辑,形成"理论为魂、算法为骨、数据为血、应用为魄"的培养格局,为国家"双一流"建设学科核心方向,在教育部第五轮学科评估中统计学获评a+、计算机科学与技术获评a类、数学获评a类。
研究方向涵盖:统计学习理论(vc维/rademacher复杂度/pac学习/泛化误差界/minimax理论/学习率/偏差-方差分解/模型选择准则aic/bic/交叉验证理论)、监督学习经典方法(线性模型/逻辑回归/支持向量机svm/核方法/高斯过程/贝叶斯线性回归/决策树/随机森林/梯度提升树xgboost/lightgbm/catboost)、深度学习理论与架构(前馈网络/卷积神经网络cnn/循环神经网络rnn/lstm/transformer/注意力机制/graph neural network gnn/diffusion model/自编码器/生成对抗网络gan/变分自编码器vae/normalizing flow)、优化理论与算法(凸优化/非凸优化/随机梯度下降sgd/adam/lbfgs/proximal method/分布式优化/二阶方法/学习率调度/收敛性分析/鞍点逃逸)、高维统计与稀疏学习(compressed sensing/sparse pca/group lasso/sparse coding/dictionary learning/matrix completion/tensor decomposition)、无监督学习与表示学习(聚类/k-means/spectral clustering/topic model/lda/pca/ica/manifold learning/contrastive learning/self-supervised learning)、生成模型与生成式ai(diffusion model/score matching/denoising/flow matching/大语言模型统计理论/in-context learning理论)、因果机器学习(causal discovery/causal representation learning/invariant risk minimization/causal forest/double machine learning/meta-learners)、联邦学习与隐私保护机器学习(federated averaging/secure aggregation/differential privacy in ml/split learning/communication efficiency/heterogeneity)、强化学习与序贯决策(markov decision process/q-learning/policy gradient/actor-critic/rlhf/offline rl/multi-agent rl)、可解释性与公平性(shap/lime/integrated gradients/counterfactual explanations/algorithmic fairness/equalized odds/demographic parity/individual fairness)、统计计算与大规模学习(分布式计算/并行优化/online learning/bandit/streaming data/concept drift/active learning)、应用领域(自然语言处理nlp/计算机视觉cv/生物医学统计学习/金融量化/推荐系统/药物发现/气象预测/自动驾驶感知)等核心议题。当前团队深度参与国家"新一代人工智能"重大科技专项、上海市人工智能实验室基础模型研究、国家自然科学基金"深度学习统计理论"创新研究群体项目、国家"脑科学与类脑研究"统计建模支撑、央行反欺诈模型与金融风险预警、国家药监局ai辅助药物筛选统计评价等国家重大任务。
选拔要求申请者绩点位列专业前5%-10%,核心课程涵盖数学分析、高等代数、概率论、数理统计、最优化方法、机器学习、深度学习、回归分析、随机过程、矩阵论、数值分析、python/pytorch/jax等;英语六级530分以上,需具备journal of machine learning research(jmlr)、annals of statistics、journal of the american statistical association(jasa)、neural computation、machine learning、《计算机学报》《软件学报》《自动化学报》及neurips/icml/iclr/aistats/uai顶会论文精读能力;科研经历偏好算法推导与实现、模拟实验设计、理论证明(收敛性/泛化界/极小极大下界)、实证建模、开源代码贡献等训练。2026年推免预选拔通知已发布,建议尽早联系导师展示扎实的数学功底、敏锐的算法直觉与"以理论驾驭算法、以统计守护智能"的专业素养。
二、知点保研核心优势
一是近十年深耕保研辅导,精准把握该方向"统计理论—优化算法—模型架构—应用落地"四维一体的选拔逻辑;二是专注复旦,在统计与数据科学系、大数据学院、计算机学院、数学科学学院、上海数学中心、上海市统计与数据科学重点实验室等平台积累独家师资与信息渠道;三是定制一对一辅导,匹配统计学习理论、优化算法、深度学习理论、生成模型、因果机器学习、联邦学习、强化学习、可解释性与公平性、高维稀疏学习、行业应用等子方向导师;四是线上线下融合,结合定理推导训练、算法代码复现(pytorch/jax)、模拟实验设计、顶会论文精读与rebuttal写作训练;五是严格督学与全流程规划闭环服务。
三、辅导体系
围绕考核需求构建核心模块:绩点提升强化数学分析、高等代数、概率论、数理统计、最优化方法、机器学习、深度学习、回归分析、随机过程等高权重课程;英语提升聚焦jmlr、annals of statistics、jasa、neurips/icml/iclr proceedings等期刊与顶会精读与statistical learning theory、vapnik-chervonenkis(vc)dimension、rademacher complexity、pac learning、generalization error bound、minimax rate、bias-variance decomposition、model selection、cross-validation、regularization、lasso、ridge regression、elastic net、support vector machine(svm)、kernel method、reproducing kernel hilbert space(rkhs)、gaussian process、decision tree、random forest、gradient boosting、xgboost、lightgbm、catboost、neural network、deep learning、convolutional neural network(cnn)、recurrent neural network(rnn)、long short-term memory(lstm)、transformer、attention mechanism、self-attention、multi-head attention、positional encoding、graph neural network(gnn)、message passing neural network(mpnn)、variational autoencoder(vae)、generative adversarial network(gan)、denoising diffusion probabilistic model(ddpm)、score matching、flow matching、normalizing flow、contrastive learning、self-supervised learning、representation learning、feature learning、manifold learning、spectral clustering、topic model、latent dirichlet allocation(lda)、principal component analysis(pca)、independent component analysis(ica)、matrix completion、tensor decomposition、compressed sensing、sparse coding、dictionary learning、convex optimization、non-convex optimization、stochastic gradient descent(sgd)、adam、adagrad、rmsprop、lbfgs、proximal operator、convergence rate、saddle point escape、learning rate schedule、warm-up、distributed optimization、federated averaging(fedavg)、secure aggregation、differential privacy、gradient clipping、communication compression、data heterogeneity、non-iid、causal discovery、causal representation learning、invariant risk minimization(irm)、causal forest、double machine learning(dml)、meta-learners、s-learner/t-learner/x-learner、markov decision process(mdp)、q-learning、policy gradient、actor-critic、proximal policy optimization(ppo)、reinforcement learning from human feedback(rlhf)、offline reinforcement learning、multi-agent reinforcement learning、shapley value、lime、integrated gradients、counterfactual explanation、algorithmic fairness、equalized odds、demographic parity、individual fairness、group fairness、online learning、multi-armed bandit、regret bound、concept drift、active learning、transfer learning、domain adaptation、meta-learning、few-shot learning、in-context learning、emergent ability、scaling law、loss landscape、neural tangent kernel(ntk)、double descent、benign overfitting、implicit regularization、lottery ticket hypothesis、knowledge distillation、model compression、quantization、pruning、bayesian deep learning、uncertainty quantification、monte carlo dropout、deep ensemble、calibration、out-of-distribution detection等前沿术语表达;论文辅导引导选择transformer架构中注意力机制的统计极小极大最优性证明、扩散模型去噪过程中score function估计的收敛速率与样本复杂度分析、联邦学习中非iid数据下fedavg收敛性改善的方差缩减策略、因果表示学习中不变性约束的充分性与必要性条件、深度神经网络"双重下降"现象的统计理论解释——基于偏差-方差分解的新视角、对比学习中负样本数量对表示学习泛化性能的理论刻画、大语言模型in-context learning的贝叶斯推断解释与统计极限、强化学习中rlhf奖励模型偏差对策略优化的影响及修正、图神经网络在异质图上的谱收敛理论与自适应聚合机制、高维稀疏因果发现中约束条件可识别性的统计检验方法等前沿议题。
专业课覆盖概率论与数理统计(高级)、最优化理论与方法(凸/非凸/随机/分布式)、统计学习理论(vc理论/泛化界/minimax)、机器学习经典方法(svm/树模型/核方法/贝叶斯方法)、深度学习理论与架构、生成模型(gan/vae/diffusion/flow)、因果机器学习、联邦学习与隐私保护、强化学习、可解释性与算法公平、高维统计与稀疏学习、大规模分布式计算、学术写作与定理证明规范等;笔试训练涵盖统计学习定理证明题(泛化界推导/收敛性证明/minimax下界构造)、损失函数设计与性质分析题、优化算法推导与复杂度分析题、模型推导与实现题(给定场景设计正则化/核函数/网络结构)、模拟实验设计与结果解读题、英文顶会论文方法论评述题、算法伪代码编写与收敛性分析题等;面试模拟强化"数学功底—算法直觉—理论品味—工程实现—应用洞察"五维平衡,针对"统计学习理论中的泛化界为何在实践中往往过于保守——理论价值何在""深度学习'过参数化'为何不导致过拟合——'良性过拟合'的理论解释""vc维理论能否解释transformer的泛化能力""sgd的隐式正则化效应如何严格刻画""生成模型中diffusion与gan的统计本质差异""因果推断与机器学习的根本张力——'预测'与'干预'的鸿沟""联邦学习中'统计异质性'与'系统异质性'的解耦策略""强化学习中'探索-利用'困境的统计最优解""算法公平性指标之间的不可能定理如何应对""大模型时代统计机器学习理论是否面临范式重构""可解释性与模型性能的内在矛盾如何调和""统计视角对'涌现能力'的解释力边界""神经网络正切核(ntk)理论的适用条件与局限""double descent现象对经典偏差-方差理论的挑战""贝叶斯深度学习的不确定性量化在高风险决策中的价值"等高频追问专项训练;文书打磨突出"从概率公理到算法收敛、从数学抽象到智能涌现、从理论优美到工程有效"的转化能力与"以统计之严谨驾驭算法之力量、以理论之光照亮黑箱之谜"的价值坚守。
竞赛与项目陪伴支持全国大学生数学竞赛(数学类)、全国大学生统计建模大赛、kaggle/天池数据科学竞赛、"华为杯"中国研究生数学建模竞赛、国际机器学习大会(neurips/icml/iclr)论文投稿辅导、中国人工智能学会(caai)青年学者论坛、全国高校"统计与数据科学"暑期学校、ims china student paper competition、"挑战杯"自然科学类学术论文、国际大学生超级计算机竞赛(sc/isc/asc)等赛事,并提供复旦大学统计与数据科学系理论课题组参与、上海市人工智能实验室基础模型研究项目、国家自然科学基金"深度学习统计理论"创新群体子课题、华为诺亚方舟实验室/腾讯ai lab/阿里达摩院联合研究、国家"脑科学与类脑研究"统计建模项目、国家药监局ai药物筛选统计评价项目、国际统计学会(isi)世界统计大会及aistats/uai学术交流等内推机会。
统计机器学习是人工智能的"第一性原理",是连接数学之美与智能之用的核心桥梁。当前我国在深度学习统计理论原创、大模型泛化机制解释、因果与统计学习融合、联邦学习理论保证、算法公平性形式化等领域与国际最前沿仍有差距,亟需兼具深厚数学功底、敏锐算法直觉、扎实工程能力与广阔应用视野的高层次理论-算法复合型人才。知点保研愿助力有志于"以概率为经、以优化为纬、以理论铸魂、以算法济世"的同学稳步前行。咨询报名可致电4000003363,或添加微信13671344286获取个性化评估与规划建议。


















