数据治理
2 篇文章
- Stanford CS336 第十三讲精读:Data 1——数据不会从天上掉下来,从 BERT 的 BooksCorpus 到 Nemotron-CC 的完整数据工程史斯坦福 CS336(Language Modeling from Scratch, Spring 2025)第十三讲完整讲义,主讲 Percy Liang。这一讲把『预训练数据』当成一门工程来教:开场先给出一句暴论——数据是决定语言模型好坏最重要的东西,然后从 BERT 的 BooksCorpus 与 Wikipedia 讲起,走过 Common Crawl、CCNet、C4、WebText、GPT-3、The Pile、MassiveText、LLaMA、RefinedWeb、FineWeb、Dolma、DCLM/DataComp,一直讲到 Nemotron-CC 的『改写 + 任务化』合成路线;中间穿插数据投毒、影子图书馆、代码与问答数据;最后用大段时间讲版权——许可、Creative Commons、合理使用的四个要素、以及『合法也可能被服务条款挡住』。收尾是那句关键的一课:数据不会从天上掉下来,你得动手去弄。
- Stanford CS336 第十四讲精读:Data 2——过滤与去重的算法机制,从 KenLM、fastText、重要性重采样到布隆过滤器与 MinHash LSH斯坦福 CS336(Language Modeling from Scratch, Spring 2025)第十四讲完整讲义,主讲 Percy Liang。上一讲是数据集的编年史,这一讲转向机制:先把『过滤』抽象成『给定小份高质量目标数据 T 和大量原始数据 R,找出与 T 相似的子集 T′』,再依次讲三种实现——n-gram 语言模型(KenLM / Kneser-Ney)、fastText 线性分类器(词袋 + hashing trick)、以及重要性重采样(DSIR);接着用语言识别、质量过滤、毒性过滤三个案例说明同一套机器怎么复用;后半程进入去重,先分清精确重复与近重复,讲哈希分组与布隆过滤器(含假阳性率的推导与最优哈希函数个数 k≈(m/n)ln2),再讲 Jaccard 相似度、MinHash 的碰撞概率证明、以及 LSH 的『与/或』band 结构如何把相似度概率曲线锐化成一条近乎阶跃的 sigmoid。收尾是那句总结:哈希之所以重要,是因为它把成对的相似与碰撞变成了一元函数,从而让线性时间成为可能。