天才一秒记住【舞会小说网】地址:https://www.whwtrl.com
四、数据的量化分析
banner"
>
在做好了充分的准备工作(数据的搜集和初步处理)之后,陈冬华等便开始着手进行量化分析。
他们用的量化分析的办法就是统计学和计量史学中最常用的“回归分析”
(regressionanalysis)。
所谓“回归”
,就是从统计角度考察某一个变量可以多大程度上被其他一些变量所解释。
若被解释的那个变量用y来表示,而关键的那个解释变量用x来表示,那么“回归分析”
就是建立一个简单的计量统计学模型:
y=ax+bz+ε。
其中z是表示除了x之外可能会影响被解释变量的其他可观测因素。
而ε则表示除了x之外可能会影响被解释变量的其他不可观测因素。
这个回归方程背后的假设是,被解释变量y跟关键的解释变量之间呈现出线性的关系。
当关键解释变量x变化之后,被解释变量会随着x的变化的a倍做出相应的变化。
在这个简单的统计学模型中,我们假设了y可以线性地由x,z,ε表示。
或者说这四者之间满足了上面这个式子所描述的线性的关系。
而在模型中,我们没有假设的是x和z前面的系数a和b的具体数据。
a和b的具体数值需要用统计学或者计量史学的工具通过数据估算出来。
从理论上来说,这样一个具体方程形式的设定就意味着我们人为地假设了一个数据生成的基本过程。
但模型没有对过程的具体情况(a和b的数值大小)做出假设。
a和b的具体数值大小,需要通过数据和统计学中的工具计算生成。
在统计学中,用数据来“复原”
回归方程中的系数,最常见的办法叫作“最小二乘法”
。
在这种方法下,计算出来的系数a和b可以使得我们假设的数据生成的过程离现实世界的真相最接近,简单来说也就是可以最大限度地让我们的回归模型接近现实数据,或者说让回归模型的解释力度在可行范围内达到最大。
回到陈冬华等的具体研究中,他们想解释的“变量”
是历史认可的个人道德(这个变量就对应上面回归模型中的y),而核心的被解释变量则是诗歌的造诣(这个变量就对应上面回归模型中的x)。
一般而言,回归方程中的被解释变量y和核心的解释变量x并不一定是离散的二元0-1变量,而可以是任意的实数。
计量史学和统计学已经发展出一系列重要的工具来分析一般化的线性[13]回归模型[14]。
回归模型中的系数a就表示了诗歌是否被《唐诗三百首》收录对个体道德情操的作用。
[15]
在运用统计方法处理数据之前,仍然有一点要说明的,就是关于回归方程中的变量z。
一般我们把非核心的解释变量称为“控制”
变量。
在这个具体的例子里面是指,一个人的道德情操可能受各种因素的影响,而诗歌的造诣只是其中一个因素。
官员的任期时间、年龄、个人经历等因素都可能会影响到一个人的道德情操。
因此我们在看诗歌造诣对道德影响的时候,一定要控制住其他的因素。
本章未完,请点击下一章继续阅读!若浏览器显示没有新章节了,请尝试点击右上角↗️或右下角↘️的菜单,退出阅读模式即可,谢谢!