<!--more--> ## 一、word-Embedding ### 1.1 为什么 one-hot vector 是一个糟糕的选择 之前在学习逻辑回归的时候,采用 one-hot vector 来进行建模,分类。 独热编码非常易于构建,但它却很难去精准表达不同词之间的相似度。 比如我们如果用向量来表示 "queen" 和 "king",那么我们很可能希望得到 `"queen" - "king" = "woman"` ### 1.2 自监督的word2vec word2vec 有两个模型:**跳元模型(skip-gram)**和**连续词袋(CBOW)**。 对 …
<!--more--> ## 一、自注意力机制 ### 1.1 为什么需要注意力机制 假如输入一句话: > 我昨天买了一本关于深度学习的书,它非常有意思。 > 如果模型现在要理解“它”指代什么,它其实应该**重点**看前面的“书”,而不是**平均**看整句话。 传统的 RNN/LSTM 虽然能处理序列,但有两个问题: 1. **长距离依赖难学** - 前面的信息传到后面会逐渐衰减 2. **所有信息被压缩到一个固定长度表示中** - 容易丢失细节 注意力机制解决的核心思路是:**在生成当前表示时,直接去“检索”输入序列中最相关的位置。** …
测试博客 代码段 print('hello world!') LaTeX公式 $$ \phi(x) = x\prod_{i=1}^{k} (1 - \frac{1}{p_i}) $$ 图片 H1 H2 H3 H4