Long Short-Term Memory
打开互动全文版(逐段中英对照 + 图/公式 + 论文问答)→通过循环反向传播学习在延长的时间间隔内存储信息需要很长时间,主要是因为误差反向流动不足且衰减。我们简要回顾了 Hochreiter(1991)对这一问题的分析,然后通过引入一种新颖、高效的基于梯度的方法——长短期记忆(LSTM)来解决它。在不会造成损害的地方截断梯度,LSTM 可以通过在特殊单元内强制恒定误差流经恒定误差传送带,学习桥接超过 1000 个离散时间步的最小时间延迟。乘法门单元学习打开和关闭对恒定误差流的访问。LSTM 在空间和时间上是局部的;其每时间步和权重的计算复杂度为 O(1)。我们在人工数据上的实验涉及局部、分布式、实值和带噪声的模式表示。与实时循环学习、时间反向传播、循环级联相关、Elman 网络和神经序列分块相比,LSTM 实现了更多成功的运行,并且学习速度更快。LSTM 还解决了先前循环网络算法从未解决过的复杂、人工长时延任务。1 引言 原则上,循环网络可以利用其反馈连接以激活的形式存储近期输入事件的表示(短期记忆,与由缓慢变化的权重体现的长期记忆相对)。这对许多应用具有潜在重要意义,包括语音处理、非马尔可夫控制和音乐作曲(Mozer, 1992)。然而,最广泛使用的学习短期记忆内容的算法需要太多时间或根本效果不佳,特别是当输入与相应教师信号之间的最小时间延迟较长时。尽管理论上有趣,现有方法并未提供比具有有限时间窗口的前馈网络中的反向传播更明确的实际优势。本文回顾了对此问题的分析并提出了补救措施。 问题。使用传统的随时间反向传播(BPTT; Williams & Zipser, 1992; Werbos, 1988)或实时循环学习(RTRL; Robinson & Fallside, 1987),在时间上反向流动的误差信号往往(1)爆炸或(2)消失;反向传播误差的时间演化指数依赖于权重的大小(Hochreiter, 1991)。情况 1 可能导致权重的振荡;情况 2 中,学习桥接长时间延迟需要过多的时间或根本不起作用(见第 3 节)。本文提出了长短期记忆(LSTM),一种新颖的循环网络架构,结合了适当的基于梯度的学习算法。LSTM 旨在克服这些误差反向流动问题。它能够学习桥接超过 1000 步的时间间隔,即使在有噪声、不可压缩的输入序列情况下,也不会损失短时延能力。这是通过一种高效、基于梯度的算法实现的,该算法针对一种架构强制恒定(因此既不爆炸也不消失)误差流经特殊单元的内部状态(前提是梯度计算在特定架构点截断;但这不影响长期误差流)。第 2 节简要回顾先前的工作。第 3 节首先概述了 Hochreiter(1991)对消失误差的详细分析。然后以教学目的介绍了恒定误差反向传播的朴素方法,并强调了其在信息存储和检索方面的问题。这些问题导致了第 4 节描述的 LSTM 架构。第 5 节介绍大量实验以及与竞争方法的比较。LSTM 优于它们,并学会了解决其他循环网络算法未解决的复杂人工任务。第 6 节讨
Learning to store information over extended time intervals by recurrent backpropagation takes a very long time, mostly because of insufficient, decaying error backflow. We briefly review Hochreiter's (1991) analysis of this problem, then address it by introducing a novel, efficient, gradient-based method called long short-term memory (LSTM). Truncating the gradient where this does not do harm, LSTM can learn to bridge minimal time lags in excess of 1000 discrete-time steps by enforcing constant error flow through constant error carousels within special units. Multiplicative gate units learn to open and close access to the constant error flow. LSTM is local in space and time; its computational complexity per time step and weight is O(1). Our experiments with artificial data involve local, distributed, real-valued, and noisy pattern representations. In comparisons with real-time recurrent learning, backpropagation through time, recurrent cascade correlation, Elman nets, and neural sequence chunking, LSTM leads to many more successful runs, and learns much faster. LSTM also solves complex, artificial long-time-lag tasks that have never been solved by previous recurrent network algorit