<!--more--> ## 零、写在前面 记录一下CS336 assignment1 的实验部分 保证所有test都过了,其他的限于时间就不做了。 作业代码:[assignment1](https://github.com/Equinox-2003/CS336-Assignment/tree/main/assignment1) ## 一、Byte-Pair Encoding ### 1.1 Unicode 与 UTF-8 - Unicode 把字符映射到 code point。 - UTF-8 把 Unicode 字符编码成字节序列。 - …
<!--more--> ## 零、写在前面 **噪声对比估计(Noise Contrastive Estimation, 简称 NCE)** 是由 Gutmann 和 Hyvärinen 在 2010 年提出的一种强大的参数估计算法。它主要用于解决**非归一化概率模型(Unnormalized Models)**中配分函数(Partition Function)难以计算的问题。 现如今,NCE 的思想深深影响了自然语言处理(如 Word2Vec)和计算机视觉(如 SimCLR、MoCo 等对比学习方法中的 InfoNCE)。 ## 一、为什么要用 NCE? 在统计机器学习和 …
<!--more--> ## 零、写在前面 MoCo 的核心思想是:把对比学习看成一个“字典查询”问题,用一个队列维护大量负样本,并用一个动量更新的 key encoder 保证这些负样本特征的一致性,从而高效学习无监督视觉表征。 感觉这个 idea 好难想到,可能因为没有了解过对比学习? ## 一、题目和作者 ``` Momentum Contrast for Unsupervised Visual Representation Learning ``` 这个格式就是:XXX Method for XXX 用动量对比学习的方式来做无监督的视觉表征学习。 …
<!--more--> ## 零、写在前面 MAE也是将 NLP 引入CV的工作。之前ViT证明NLP是可以迁移到CV的,并且大规模训练下效果很好,但是没有解决如何有效且高效地做self-supervised training的问题。 **MAE 通过“高比例随机 mask + asymmetric encoder-decoder + masked patch pixel reconstruction”,把图像自监督学习变成一个简单、可扩展且对大模型友好的预训练范式。** ## 一、 …
<!--more--> ## 零、写在前面 这篇论文就是后面经典的Vision Transformer,核心思想很直接: > 将一张图片切成一系列固定大小的patch,把一个 patch 当作NLP任务中的一个token,然后送入标准 Transformer Encoder 做图像分类。 它证明了在足够大规模数据预训练的条件下,纯**Transformer**架构可以在图像识别任多上达到基至超过**CNN**。打破了 cv 和 nlp 在模型上的壁垒。 …
<!--more--> ## 零、写在前面 今天一看博客,图床全挂了,花了一下午试了各个渠道,都不太满意。最后偶然在L站上看到有人聊这个东西,才发现了github上这个好用的项目。 ## 一、个人图床搭建 ### 1.1 CloudFlare-ImgBed 仓库链接:[CloudFlare-ImgBed](https://github.com/MarSeventh/CloudFlare-ImgBed) ### 1.2 搭建流程 项目有非常清晰的部署文档: 1. [前期准 …
<!--more--> ## 零、前言 作为本书的最后一个章节,作者介绍了如何通过微调一个follow instruction的llm。 本章代码:[ch07](https://github.com/Equinox-2003/LLMs-from-scratch-Practice/tree/main/ch07) ## 一、Fine Tuning to Follow Instructions ### 1.1 Introduction to instruction fine-tuning **流程一览:** …
<!--more--> ## 零、写在前面 这一章主要讲了下如何对llm进行微调。 本章代码:[ch06](https://github.com/Equinox-2003/LLMs-from-scratch-Practice/tree/main/ch06) ## 一、Fine-tuning for classification ### 1.1 Different categories of fine-tuning 对语言模型最常用的微调方式有 **instruction fine-tuning** 以及 **classification fine-tuning**。 …
<!--more--> ## 零、前言 本章主要讲了下如何评价llm生成文本的质量,如何进行预训练。 本章代码:[ch05](https://github.com/Equinox-2003/LLMs-from-scratch-Practice/tree/main/ch05) ## 一、Pretraining on unlabeled data ### 1.1 Evaluating generative text models 首先回顾下 GPT 生成文本的过程: **创建GPT模型:** ```python import torch from …
<!--more--> ## 零、前言 这一章作者带着手搓了一下GPT 2的architecture,架构还是比价清晰易懂的。 本章代码:[ch04](https://github.com/Equinox-2003/LLMs-from-scratch-Practice/tree/main/ch04) ## 一、Implementing a GPT model ### 1.1 Coding a LLM architecture 像**GPT(generative pretrained transformer)**这样的LLM,都是大而深的神经网络架构,使得生成文本时一次生成 …