大数据是驱动数字经济时代国家治理现代化、产业智能化转型与科学发现范式变革的核心交叉学科,以统计学与计算机科学为双理论根基、以人工智能与系统架构为技术引擎、以中国数据要素市场化配置与数字中国建设为实践导向,承担从数据采集治理到智能分析、从隐私计算到可信流通、从大模型训练到行业赋能、从数据基础制度设计到全球数据治理的全链条理论创新与技术攻关使命。北京大学大数据硕士依托智能学院,以中国科学院院士、发展中国家科学院院士为学术领袖,以国家级高层次人才、长江学者特聘教授、国家杰出青年基金获得者为核心导师群,建成多媒体信息处理全国重点实验室、大数据分析与应用技术国家工程实验室、北京智源人工智能研究院(联合共建)、北京大学数据科学研究中心等国家级平台,涵盖数据科学与统计学习、大数据系统与分布式计算、人工智能与大模型、隐私计算与数据安全、大数据赋能自然科学(AI for Science)、数据治理与数字经济六大研究方向,以"统计理论与计算方法深度融合引领原创算法突破、自主可控大数据系统支撑国家数据基础设施、大模型时代数据智能赋能千行百业、数据要素基础制度研究服务数字中国顶层设计"为学科发展主线,培养兼具深厚数理统计功底、卓越系统工程能力与中国数据战略视野的高层次大数据专门人才。
学科沿革: 北京大学智能学院的前身可追溯至1978年成立的北京大学计算机科学技术系模式识别与机器智能教研室,是国内最早开展人工智能与数据科学研究的学术机构之一。2003年,北京大学成立信息科学技术学院智能科学系,设立国内首个"智能科学与技术"本科专业。2021年,北京大学整合校内人工智能、数据科学、机器人等优势力量,正式成立智能学院,标志着北大在智能科学与大数据交叉领域进入建制化发展新阶段。学院现设有智能科学与技术系、数据科学系、机器人工程系三个教学单位,拥有计算机科学与技术、软件工程两个国家一级重点学科,以及智能科学与技术交叉学科博士点。大数据分析与应用技术国家工程实验室于2016年获国家发改委批复建设,是国内首批聚焦大数据核心技术的国家级工程实验室;多媒体信息处理全国重点实验室前身为视觉信息处理与学习教育部重点实验室,2023年完成重组并获批全国重点实验室。2024年,学院牵头成立北京大学数据科学研究中心,统筹全校数据科学研究力量,对接国家数据局成立后的数据要素市场化改革需求。2025年,学院与国家数据局、北京市大数据中心、华为、百度、阿里等建立联合实验室与实习基地,构建"产学研用"一体化培养生态。2026年,学院大数据硕士项目进一步优化方向设置,新增"大模型与生成式AI"方向和"数据要素与数字经济"方向,回应大模型时代数据智能新范式与国家数据基础制度建设双重需求。
学术成就与国家战略贡献: 智能学院教师在国内外顶级期刊与会议发表论文逾千篇,覆盖Nature/Science子刊、IEEE TPAMI/IJCV、NeurIPS/ICML/ICLR/CVPR/ACL、《中国科学》《计算机学报》《软件学报》等权威刊物。获国家自然科学二等奖3项、国家技术发明二等奖2项、教育部自然科学一等奖4项、CCF自然科学一等奖2项。大数据分析与应用技术国家工程实验室研发的"数智底座"系列成果已应用于国家宏观经济监测、公共卫生应急预警、城市交通大脑、工业互联网平台等重大场景,相关技术入选工信部"大数据产业发展试点示范项目"。学院团队深度参与国家数据基础制度顶层设计,多位教授担任国家数据专家咨询委员会委员、全国数据标准化技术委员会工作组组长,研究成果直接服务于《关于构建数据基础制度更好发挥数据要素作用的意见》("数据二十条")配套政策制定、公共数据授权运营机制设计、数据资产入表会计准则研究等国家重大改革任务。在AI for Science方向,学院与北京大学理科院系联合开展蛋白质结构预测、气象预报AI加速、新材料高通量筛选等前沿研究,相关成果发表于Nature Communications/PNAS等期刊。学院还主办《大数据》期刊(中国科技核心期刊)、北京大学大数据论坛、中国大数据技术与应用大会等学术平台,搭建学界、业界与政府部门对话桥梁。
导师团队: 院士级学术领袖(中国科学院院士、发展中国家科学院院士,北京大学博雅讲席教授、智能学院教授,长期从事机器学习、模式识别、计算机视觉、大数据分析研究,主持国家重点研发计划、国家自然科学基金重大项目等,获国家自然科学二等奖、IEEE PAMI杰出研究者奖,中国人工智能学会名誉理事长、国际模式识别协会IAPR Fellow);大数据分析与应用技术国家工程实验室主任(博士生导师,国家级高层次人才,长江学者特聘教授,研究方向为大数据系统架构、流数据处理、图计算、数据治理,主持国家863计划、重点研发计划,研发的大数据平台已在多个国家级信息系统部署应用);数据科学系主任(博士生导师,国家杰出青年基金获得者,研究方向为高维统计推断、因果推断、非参数统计、统计机器学习,在Annals of Statistics/JASA/NeurIPS发表系列成果,美国统计学会ASA Fellow);人工智能与大模型方向教授(博士生导师,研究方向为大规模预训练模型、多模态学习、指令微调与对齐、高效推理与部署,在NeurIPS/ICML/ACL/CVPR发表多篇高引论文,北京智源人工智能研究院核心研究员);隐私计算与数据安全方向教授(博士生导师,研究方向为联邦学习、差分隐私、同态加密、安全多方计算、数据确权与溯源,主持国家重点研发计划"网络空间安全"专项,国家密码管理局咨询专家);大数据系统与分布式计算方向教授(博士生导师,研究方向为云原生数据平台、存算一体架构、GPU/NPU异构计算、数据库内核优化,曾任头部互联网公司大数据平台首席架构师,在SIGMOD/VLDB/OSDI发表成果);AI for Science方向教授(博士生导师,研究方向为神经网络求解偏微分方程、分子动力学机器学习势函数、气象AI预报模型、蛋白质设计,在Nature Communications/PNAS/JCP发表成果);数据治理与数字经济方向教授(博士生导师,研究方向为数据要素定价、公共数据开放、数据资产评估、数字经济测度、平台经济反垄断,主持国家社科基金重大项目,国家数据专家咨询委员会委员);机器人感知与具身智能方向教授(博士生导师,研究方向为三维视觉、SLAM、触觉感知、机器人学习、人机协作,在ICRA/IROS/RSS/CVPR发表系列成果);此外还有来自北京大学数学科学学院、计算机学院、光华管理学院、政府管理学院、国家发展研究院的联合导师群,以及来自国家数据局、华为、百度、阿里、腾讯、字节跳动等机构的产业导师团队。
保研核心要求: 北京大学智能学院2026年硕士研究生招生中,大数据硕士隶属于085400电子信息(专业学位),设数据科学与统计学习、大数据系统与架构、人工智能与大模型、隐私计算与数据安全、AI for Science、数据治理与数字经济等研究方向。统考初试科目为:①101思想政治理论、②201英语(一)、③301数学(一)、④408计算机学科专业基础。2026年复试基本分数线为365分,单科要求:政治≥55分、外语≥55分、业务课一(数学一)≥90分、业务课二(408)≥90分。总成绩计算办法:初试成绩÷5×60% + 复试成绩×40%,复试权重较高,体现"数理基础+系统能力+科研潜力"三位一体的选拔理念。推免方面,2025年9月发布《北京大学智能学院2026年接收推荐免试研究生说明》,推免生需通过北京大学研究生院网上报名系统提交申请,参加材料审核与综合面试(含专业笔试+科研答辩+英文测试)。大数据硕士推免名额约占招生总计划的50%-60%,竞争极为激烈。本科背景以计算机科学与技术、软件工程、数据科学与大数据技术、统计学、数学、人工智能、电子信息工程等为主,核心竞争力在于扎实的数理与编程功底、明确的大数据研究或产业志向、高质量科研项目或竞赛经历(ACM-ICPC/Kaggle/全国大学生数据挖掘竞赛)及对中国数据战略的深刻理解。
知点保研辅导要点: 围绕大数据硕士核心能力重点辅导——①数理统计与机器学习基础(概率论与数理统计、随机过程、凸优化、线性代数与矩阵分析、统计学习理论(VC维/Rademacher复杂度)、贝叶斯方法、核方法与RKHS、深度学习理论(泛化/优化/表示学习)、因果推断(do-calculus/工具变量/DID/RD)、高维统计(LASSO/SCAD/阈值估计)、非参数与半参数方法);②大数据系统与分布式计算(操作系统与并发编程、计算机网络、数据库系统原理(SQL/NoSQL/NewSQL)、分布式系统(MapReduce/Spark/Flink)、云计算与容器化(Kubernetes/Docker)、GPU/NPU异构计算与CUDA编程、存储系统(HDFS/Ceph/S3)、消息队列(Kafka/Pulsar)、大数据平台运维与监控、性能调优与Benchmarking);③人工智能与大模型(Transformer架构详解、预训练-微调-对齐三阶段范式、RLHF/DPO/PPO对齐算法、LoRA/QLoRA参数高效微调、Prompt Engineering与In-Context Learning、检索增强生成(RAG)、多模态大模型(CLIP/Flamingo/GPT-4V)、Agent与工具使用、模型压缩与量化(GPTQ/AWQ/INT4)、推理加速(vLLM/TensorRT/Speculative Decoding)、大模型评测与安全(Red Teaming/Jailbreak防御));④隐私计算与数据安全(联邦学习框架(FedAvg/FedProx/Secure Aggregation)、差分隐私(Laplace/Gaussian/Exponential Mechanism/Rényi DP)、同态加密(Paillier/BGV/CKKS)、安全多方计算(Secret Sharing/Garbled Circuits/Oblivious Transfer)、可信执行环境(SGX/TDX/SEV)、数据脱敏与匿名化(k-anonymity/l-diversity/t-closeness)、数据水印与溯源、区块链与数据确权、个人信息保护法/数据安全法合规实务);⑤AI for Science(神经网络求解PDE(PINNs/DeepONet/FNO)、分子表征学习与药物发现(GNN/Transformer/扩散模型)、气象AI预报(FourCastNet/Pangu-Weather/GraphCast)、蛋白质结构预测与设计(AlphaFold/ESMFold/RFdiffusion)、材料科学高通量筛选、天文数据分析与引力波检测、基因组学与单细胞测序AI分析、科学计算与HPC基础);⑥数据治理与数字经济(数据要素市场化配置理论、数据资产确认与计量(财会〔2023〕11号)、公共数据授权运营机制、数据交易场所与合规体系、数据分类分级与安全管理、数据质量评估与元数据管理、数字经济测度与卫星账户、平台经济反垄断与算法监管、跨境数据流动与全球数据治理(GDPR/CPTPP/DEPA)、数据伦理与算法公平);⑦编程与工程实践(Python/PyTorch/JAX深度学习框架、C++/Rust高性能计算、SQL/Spark SQL数据查询、Linux/Shell脚本、Git版本控制、Docker/Kubernetes容器编排、MLflow/W&B实验管理、LaTeX学术写作、开源社区贡献与代码规范);⑧科研能力培养(顶会论文写作与投稿策略(NeurIPS/ICML/ICLR/CVPR/ACL/SIGMOD/VLDB)、实验设计与消融实验规范、理论证明与数值验证结合、开源代码复现与可重复性研究、学术报告与海报展示、跨学科合作沟通(计算机×统计×经济×物理/生物/医学)、专利申请与技术交底书撰写);⑨国家战略与产业素养(数字中国建设整体布局规划解读、国家数据局职能与政策体系、"数据二十条"与配套细则、东数西算工程与算力基础设施、数据要素×三年行动计划、人工智能+行动、国产信创与自主可控、中美科技竞争中的数据博弈、数据主权与全球数字治理规则谈判)。面试训练涵盖专业笔试强化(408数据结构/操作系统/计算机网络/组成原理核心题型、机器学习推导题、算法设计与复杂度分析)、大数据前沿问题问答(大模型Scaling Law的理论解释、联邦学习通信效率与隐私保护的权衡、公共数据授权运营的激励相容机制设计、AI for Science中物理约束与数据驱动的融合路径、数据资产入表的估值方法论争议)、系统设计题(实时推荐系统/分布式训练平台/隐私保护数据分析流水线)、科研设想陈述及英文学术表达。文书应体现"以数理洞察驱动数据智能原创突破、以自主系统支撑国家数据基础设施、以交叉融合赋能科学发现与产业升级、以制度创新激活数据要素价值"的高层次大数据人才志向,突出对特定研究瓶颈(如大模型训练数据版权与合规边界、联邦学习在非IID数据下的收敛保证、公共数据开放中的隐私泄露风险量化评估、AI求解高维PDE的误差界与可靠性认证、数据要素定价的市场均衡机制设计、国产AI芯片生态与大模型适配等)的深刻洞察与突破路径的原创性思考。
咨询保研报名事宜,请拨打4000003363,或添加微信13671344286,获取一对一详细解答。


















