量子力学笔记2 自旋 这篇笔记根据ScienceClic的视频来写 可能存在错误 文末会给出之前一直没有搞清楚的疑问:“为什么说粒子可以用庞加莱群的不可约表示来描述”,某种意义上说,就是一种通过数学统一描述的手段,就类似希尔伯特空间一样。 群可以来描述对空间中的某个对称的物体的某种对称操作,如Z4循环群可以等价地描述成旋转{90度,180度,270度,360度},钟表上的小时刻度可以用Z12这个群来描述,而对于无限大的连续群,如0到360度的全部旋转,用SO(2)来描述,它描述了2维空间的全部旋转,而SO(3)描述了3维空间的全部旋转。而洛伦兹群SO(3,1)(有时候写成SO(1,3))描述了3+1维时空下的洛伦兹变换(惯性系之间的变换)和所有空间旋转。由于二维中任意旋转都能写成一个矩阵元素是三角函数的二阶矩阵的形式,在数学上,称为SOn特殊正交群——所有行列式为1的实正交矩阵,这两个定义在数学上是等价的。对于一个现实世界的粒子,其存在内部的属性,如自旋,施特恩-格拉赫实验表明原子有类似角动量的属性使其在磁场中偏移方向,而这种属性是离散的、量子化的。 下面先说视频中给出的不严谨的理解方式:考虑将Z4循环群作为4种旋转角度,作用在一个粒子上,可能有不同的作用结果, 群作用在粒子上,粒子看上去旋转了几次,称为该粒子的“自旋数”,衡量了在空间旋转一圈的作用下,粒子回到初始状态的快慢,上述过程严格理解要用群表示,而简要理解则是可以用类似挂谷猜想的那种,自己转了多少圈的理解方式。自旋数为0的物体用一个数描述,表示在旋转下不变,为1的物体用向量描述,为2的用矩阵描述。那么考虑整个宇宙的所有旋转,就是考虑SO(3)或者SO(3,1)的表示,依旧有自旋数,区分了粒子根据对于旋转的反应,可以用哪些数学工具来描述粒子。然而,有些粒子的自旋数是分数如1/2,也就是说,要整个空间转两圈,它才会转回来。在量子力学中,一次旋转可以描述成对波函数取负(注意不是复共轭),为什么对于自旋1/2对粒子,时空转了一圈,就是对波函数取负呢?电子自旋放在磁场中。磁场会让自旋发生变化。控制磁场强度和作用时间,可以让自旋状态经历相当于时空进行了旋转,测量后即可验证这一切。而这不改变波函数的平方,也不改变可观测量的期望(因为算积分的时候复共轭也取了一次负号,乘在一起抵消了)。然而这种状态与其负态虽然可观测量完全一样,但是与其他状态叠加在一起的时候就不一样了。如两个波函数的叠加,其中一个取负,就是另一个状态。所以本质上时空转了一圈,粒子不算完全转了一圈。 下面来看群表示下的严格定义,为什么上述过程可以用群表示来描述呢?群G的矩阵表示的定义是“从G到一个特定维数的一般复线性群(n阶,元素为复数的可逆矩阵,n称为维数)的同态” 。 为什么“群表示”能够描述粒子的自旋呢?假设空间旋转 R 对应所有可能的量子态或者说,波函数,构成的向量空间上的线性变换U(R),先后旋转R1再旋转R2,有U(R2R1)=U(R2)U(R1),而这个条件则正好是群同态的条件,具体而言是SO(3)(注:空间旋转群)到GL(V)(注:V是描述物理对象状态的波函数构成的向量空间,GL(V)是V上所有可逆线性变换构成的群)上的同态,U(R)是空间旋转 R 在状态空间 V 上对应的线性变换,总而言之,就是可以一一对应起来,群描述“空间怎么变”,群表示描述了一系列线性变换(空间旋转R),同态后,变成了哪些的另一些的线性变换。 所有这些信息包括起来,就可以很完整得描述了所有的可能的量子态,包括粒子属性、自由度等等。那么,粒子是庞加莱群的不可约表示也很好理解了——SO(3,1)是洛伦兹群,再包括了时空平移等对称性,可以通过通过半直积构成描述时空全部对称性的群,从这个群出发的上述群表示,就可以完整描述这一切。Wigner 分类进一步告诉我们,有质量粒子由质量 m 和自旋 s 标记。上一篇量子力学笔记提到狄拉克研究了狄拉克函数,后来狄拉克又研究了洛伦兹群,预言了反粒子的存在。
这是一篇扩散模型的笔记,不一定正确。如果直接训练文字到图片的模型,如果训练集黑猫白猫各一半输入猫会训练出灰猫,而扩散模型为什么就能解决这个问题呢,最后输出是各一半吗?是这样的,底层的高斯噪声是随机的,所以理想情况下,结果是各一半。不过其实有很多其他的模型也能做到,如VAE、GAN,对于真正需要“一对多”的生成问题,通常都需要某种额外的随机自由度,即x不等于f(提示词),而是x=f(提示词,随机变量),随机变量(如果是多个,可以看作一条向量)的取值范围被映射到不同的结果。为什么扩散模型的构造会有这个结果呢?根据得分匹配理论,预测噪声在数学上转化为当前数据分布的对数概率梯度,称为得分score。考虑所有可能的图像(包括像素和颜色)的空间,每个点的高度对应这当前提示词下图片的概率,神经网络学习的不再是“当前提示词下这只猫长什么样”,而是“在当前这个噪声图多维坐标点上,当前提示词确定的概率空间,往哪个方向走,让图像变得更真实的概率上升得最快”。这样黑猫白猫对应着两个高概率区域,通过去噪可以落入一个区域中,大量重复下,可以学出所有的梯度方向,这也就对应了整个概率分布。因为知道所有的导数意味着知道所有点的值,不需要一个初值,如果可以归一化,理论上就可以复原整个函数。下面是具体的笔记:一开始,如果不乘系数,n步就是n倍的高斯噪声,那么新的图就服从以原图为中心 n倍方差的高斯分布,但是这样没法变成标准正态分布。ddpm的论文作者选择了乘一个参数作为系数,总而言之数学上这样就可以变成标准正态分布了,最巧妙的地方在于,即使加了根号下的参数,迭代下的第t步是可以直接根据公式的变化算出来的。去噪过程每一步就是用最小化深度神经网络的预测误差。Transformer 学的是在提示词 c 的条件下,看到处于噪声程度 t 的图像,应该怎样朝真实图像分布的方向走。损失函数不需要计算理论上精确的平均损失,也不需要算每一步的损失,直接取第t步,直接对每个时间步当作相同权重即可。