<!--more-->
## 零、写在前面
Qwen-VL官方源码:[Qwen/Qwen-VL](https://huggingface.co/Qwen/Qwen-VL)
论文基本没什么图,感觉Method也没有介绍的很细,对比源码看看会好一些。
## 一、标题
> Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
**Qwen-VL:一个多功能的视觉语言模型,用于理解、定位、文本阅读及其他任务**
标题直接给出模型 …
2026-05-285229 字11 分钟
GPT1~GPT3技术综述
<!--more-->
## 零、写在前面
之前手搓过GPT-2([LLMs-From-Scratch](https://blog.equinox.wiki/categories/llms-from-scratch/)),然后一时兴起想梳理一下GPT1~3的技术路线。
## 一、背景:从 Transformer 到自回归语言模型
GPT 系列建立在 Transformer 之上。Transformer 最初由 Vaswani et al. 在 Attention Is All You Need 中提出,其核心是用 self-attention 取代 RNN/CNN 中的序列建 …