Jacky's blog
首页
  • 学习笔记

    • web
    • android
    • iOS
    • vue
  • 分类
  • 标签
  • 归档
收藏
  • tool
  • algo
  • python
  • java
  • server
  • growth
  • frida
  • blog
  • SP
  • more
GitHub (opens new window)

Jack Yang

编程; 随笔
首页
  • 学习笔记

    • web
    • android
    • iOS
    • vue
  • 分类
  • 标签
  • 归档
收藏
  • tool
  • algo
  • python
  • java
  • server
  • growth
  • frida
  • blog
  • SP
  • more
GitHub (opens new window)
  • shell

  • tool

  • client

  • 网络

  • compute_base

  • blog

  • growth

  • java

  • C&C++

  • ai

    • base

    • tools

    • local-llm

    • nlp基础

      • token
      • 向量
      • rnn
        • 什么是 RNN
        • 核心结构
        • 变体
        • RNN 的局限
        • Transformer vs RNN
      • HuggingFace
  • secure

  • cms

  • english

  • 生活

  • 金融学

  • more

  • other
  • ai
  • nlp基础
Jacky
2025-05-14
目录

rnn

# RNN 循环神经网络

# 什么是 RNN

Recurrent Neural Network,专门处理序列数据的神经网络,核心是隐藏状态在时间步之间传递,使网络能记住之前的信息。

# 核心结构

输入 x₀ → [RNN单元] → 输出 y₀, 隐藏状态 h₀
              ↓ h₀
输入 x₁ → [RNN单元] → 输出 y₁, 隐藏状态 h₁
              ↓ h₁
输入 x₂ → [RNN单元] → 输出 y₂, 隐藏状态 h₂
1
2
3
4
5

每个时间步的处理依赖上一步的隐藏状态,实现"记忆"。

# 变体

类型 特点
基础 RNN 简单,但长序列梯度消失
LSTM 引入门控机制,解决长依赖
GRU LSTM 简化版,参数更少

# RNN 的局限

  • 梯度消失/爆炸:长序列训练困难
  • 无法并行:必须按顺序计算,慢
  • 长距离依赖弱:信息传不远

这也是 Transformer(自注意力)取代 RNN 成为主流的原因。

# Transformer vs RNN

维度 RNN Transformer
并行性 差(顺序计算) 好(一次计算全部)
长距离依赖 弱 强(自注意力直接连接)
训练速度 慢 快
参数量 少 多
#NLP#deep-learning#AI#LLM
上次更新: 2026/09/10, 20:52:09
向量
HuggingFace

← 向量 HuggingFace→

最近更新
01
direnv
09-09
02
nvim
09-09
03
wget
09-09
更多文章>
Theme by Vdoing | Copyright © 2019-2026 Jacky | MIT License
  • 跟随系统
  • 浅色模式
  • 深色模式
  • 阅读模式