tensorflow中的梯度求解及梯度裁剪操作-巨人网络通讯

tensorflow中的梯度求解及梯度裁剪操作

1. tensorflow中梯度求解的几种方式

1.1 tf.gradients

tf.gradients(
    ys,
    xs,
    grad_ys=None,
    name='gradients',
    colocate_gradients_with_ops=False,
    gate_gradients=False,
    aggregation_method=None,
    stop_gradients=None,
    unconnected_gradients=tf.UnconnectedGradients.NONE
)

计算ys关于xs的梯度，tf.gradients返回的结果是一个长度为len(xs)的tensor列表list，例如

tf.gradients(y, [x1, x2, x3]返回[dy/dx1, dy/dx2, dy/dx3]

当y与x无关时，即graph无x到y的路径，则求y关于x的梯度时返回[None]；参数stop_gradients指定的变量对当前梯度求解而言，梯度求解将止于这些变量。

a = tf.constant(0.)
b = 2 * a
g = tf.gradients(a + b, [a, b], stop_gradients=[a, b]) #梯度计算不再追溯a,b之前的变量

输出：

In: sess.run(g)

out:[1.0, 1.0]

如果不设置stop_gradients参数则反向传播梯度计算将追溯到最开始的值a,输出结果为：

In : sess.run(g)

Out: [3.0, 1.0]

1.2 optimizer.compute_gradients

compute_gradients(
    loss,
    var_list=None,
    gate_gradients=GATE_OP,
    aggregation_method=None,
    colocate_gradients_with_ops=False,
    grad_loss=None
)

optimizer.compute_gradients是tf.gradients的封装，作用相同，但是tfgradients只返回梯度，compute_gradients返回梯度和可导的变量；tf.compute_gradients是optimizer.minimize()的第一步，optimizer.compute_gradients返回一个[(gradient, variable),…]的元组列表，其中gradient是tensor。

直观上，optimizer.compute_gradients只比tf.gradients多了一个variable输出。

optimizer = tf.train.GradientDescentOptimizer(learning_rate = 1.0)
self.train_op = optimizer.minimize(self.cost)
sess.run([train_op], feed_dict={x:data, y:labels})

在这个过程中，调用minimize方法的时候，底层进行的工作包括：

(1) 使用tf.optimizer.compute_gradients计算trainable_variables 集合中所有参数的梯度

(2) 用optimizer.apply_gradients来更新计算得到的梯度对应的变量

上面代码等价于下面代码

optimizer = tf.train.GradientDescentOptimizer(learning_rate=0.1)
grads_and_vars = optimizer.compute_gradients(loss)
train_op = optimizer.apply_gradients(grads_and_vars)

1.3 tf.stop_gradient

tf.stop_gradient(
    input,
    name=None
)

tf.stop_gradient阻止input的变量参与梯度计算，即在梯度计算的过程中屏蔽input之前的graph。

返回：关于input的梯度

2. 梯度裁剪

如果我们希望对梯度进行截断，那么就要自己计算出梯度，然后进行clip，最后应用到变量上，代码如下所示，接下来我们一一介绍其中的主要步骤

#return a list of trainable variable in you model
params = tf.trainable_variables()

#create an optimizer
opt = tf.train.GradientDescentOptimizer(self.learning_rate)

#compute gradients for params
gradients = tf.gradients(loss, params)

#process gradients
clipped_gradients, norm = tf.clip_by_global_norm(gradients,max_gradient_norm)

train_op = opt.apply_gradients(zip(clipped_gradients, params)))

2.1 tf.clip_by_global_norm介绍

tf.clip_by_global_norm(t_list, clip_norm, use_norm=None, name=None)

t_list 表示梯度张量

clip_norm是截取的比率

在应用这个函数之后，t_list[i]的更新公示变为：

global_norm = sqrt(sum(l2norm(t)**2 for t in t_list))
t_list[i] = t_list[i] * clip_norm / max(global_norm, clip_norm)

也就是分为两步：

(1) 计算所有梯度的平方和global_norm

(2) 如果梯度平方和 global_norm 超过我们指定的clip_norm，那么就对梯度进行缩放；否则就按照原本的计算结果

梯度裁剪实例2

loss = w*x*x
optimizer = tf.train.GradientDescentOptimizer(0.1)
grads_and_vars = optimizer.compute_gradients(loss,[w,x])
grads = tf.gradients(loss,[w,x])
# 修正梯度
for i,(gradient,var) in enumerate(grads_and_vars):
    if gradient is not None:
        grads_and_vars[i] = (tf.clip_by_norm(gradient,5),var)
train_op = optimizer.apply_gradients(grads_and_vars)
with tf.Session() as sess:
    sess.run(tf.global_variables_initializer())
    print(sess.run(grads_and_vars))
     # 梯度修正前[(9.0, 2.0), (12.0, 3.0)]；梯度修正后 ，[(5.0, 2.0), (5.0, 3.0)]
    print(sess.run(grads))  #[9.0, 12.0]，
    print(train_op)

补充：tensorflow框架中几种计算梯度的方式

1. tf.gradients

tf.gradients(
    ys,
    xs,
    grad_ys=None,
    name='gradients',
    colocate_gradients_with_ops=False,
    gate_gradients=False,
    aggregation_method=None,
    stop_gradients=None,
    unconnected_gradients=tf.UnconnectedGradients.NONE
)

计算ys关于xs的梯度，tf.gradients返回的结果是一个长度为len(xs)的Tensor列表list，每个张量为sum(dy/dx)，即ys关于xs的导数。

例子：

tf.gradients(y, [x1, x2, x3]返回[dy/dx1, dy/dx2, dy/dx3]

当y与x无关时，即graph无x到y的路径，则求y关于x的梯度时返回[None]

参数stop_gradients指定的变量对当前梯度求解而言，梯度求解将止于这些变量。

实例：

a = tf.constant(0.)
b = 2 * a
g = tf.gradients(a + b, [a, b], stop_gradients=[a, b]) #梯度计算不再追溯a,b之前的变量

输出：

In: sess.run(g)

out:[1.0, 1.0]

如果不设置stop_gradients参数则反向传播梯度计算将追溯到最开始的值a,输出结果为：

In : sess.run(g)

Out: [3.0, 1.0]

2. optimizer.compute_gradients

compute_gradients(
    loss,
    var_list=None,
    gate_gradients=GATE_OP,
    aggregation_method=None,
    colocate_gradients_with_ops=False,
    grad_loss=None
)

optimizer.compute_gradients是tf.gradients的封装1.

是optimizer.minimize()的第一步，返回(gradient, variable)的列表，其中gradient是tensor。

直观上，optimizer.compute_gradients只比tf.gradients多了一个variable输出。

3. tf.stop_gradient

tf.stop_gradient(
    input,
    name=None
)

tf.stop_gradient阻止input的变量参与梯度计算，即在梯度计算的过程中屏蔽input之前的graph。

返回：关于input的梯度

应用：

1、EM算法，其中M步骤不应涉及通过E步骤的输出的反向传播。

2、Boltzmann机器的对比散度训练，在区分能量函数时，训练不得反向传播通过模型生成样本的图形。

3、对抗性训练，通过对抗性示例生成过程不会发生反向训练。

以上为个人经验，希望能给大家一个参考，也希望大家多多支持脚本之家。

您可能感兴趣的文章:

使用tensorflow 实现反向传播求导
TensorFlow的自动求导原理分析
Tensorflow 如何从checkpoint文件中加载变量名和变量值
Python3安装tensorflow及配置过程
解决tensorflow 与keras 混用之坑
tensorflow中的数据类型dtype用法说明

上一篇：python numpy中multiply与*及matul 的区别说明
下一篇：Django分页器的用法你都了解吗

tensorflow中的梯度求解及梯度裁剪操作

1. tensorflow中梯度求解的几种方式 1.1 tf.gradients tf.gradients( ys, xs, grad_ys=None, name=\'gradients\', colocate_gradients_with_ops=False, gate_gradients=False, aggregation_method=None, stop_gradients=None, unconnected_gradients=tensorflow,中的,梯度,求解,...

如何把高德地图店铺显示到抖音店？如何把高德地图店铺

高德地图上的店铺怎么显示到抖音？在抖音位置选择里用高德地图标记位置发表抖音即...

安阳ai电销机器人供应商（安阳ai电销机器人供应商电话

本文目录一览： 1、哪家的ai智能电话发卖板滞人对照好？ 2、AI智能电销板滞人哪家好...

400号码申请费用详解：不同地区申请费用不同

400号码是近年来逐渐普及的电话号码，其具有易记、统一和延伸企业形象等的特点，被...

郭庚茂：用服务业带来河南的长远发展

大河网讯2008年6月26日，郭庚茂代省长在河南省服务业发展大会上的提出：加快服务业发...

内部营销与内部商标传播的含义

内部商标传播的理论前提是内部营销理论的提出。1981年,北欧服务营销学派的鼻祖芬兰...

电话营销基本话术云呼_电话机器人

4銆?鏅鸿兘璇煶鏈哄櫒浜轰笉浠呮槸涓€鍙扮畝鍗曠殑鏈哄櫒锛岃繕鍏锋湁鑷垜瀛...

遵义电话白名单是什么意思

遵义电话白名单是什么意思百应人工智能获客服务商是较领先的互联网一站式服务供应...

将django项目部署到centos的踩坑实战

前言本文介绍的是将django项目部署到centos的遇到的一些问题，关于将Django项目部署到...

400电话怎么申请开通及费用上海400电话号码费用

如何办理400电话，首先400电话只适用于企业，或个体户，个人不能办理400电话。一般来...

电话机器人效果怎么养

智能营销的新时代到来了。你在等什么？【电话机器人】 1、导入拨打数据【电话机...

400电话费用要多少400开头电话能接吗

400电话费用要多少400开头电话能接吗以下内容由巨人小编整理发布。如报任毛交还断的...

巨人科技提醒你办理过程中的误区有哪些

在我们进行400电话办理的时候，一些人因为对这个电话的主要功能以及其他的方面都不...

400电话是免费的还是收费的手机打400电话免费吗？

虽然400电话不是完全免费的，但400电话对企业的宣传作用不容忽视。由于400电话处理业...

400电话主要功能400电话的常见功能有哪些？

如今，越来越多的企业和企业选择400电话处理，掀起了400电话处理的热潮。一开始，企...

400服务商400全国服务电话

(400服务商)(400全国服务电话)以下内容由巨人小编整理发布。要想找正规的400电话服务...

tensorflow中的梯度求解及梯度裁剪操作

全 部 栏 目

1. tensorflow中梯度求解的几种方式

1.1 tf.gradients

1.2 optimizer.compute_gradients

1.3 tf.stop_gradient

2. 梯度裁剪

2.1 tf.clip_by_global_norm介绍

1. tf.gradients

例子：

2. optimizer.compute_gradients

3. tf.stop_gradient

全部栏目