← 书架

人格——为什么每个人不一样

同一个屋檐下长大的两个人,脾气可以天差地别;同一个人,在酒桌上和在世界观完全不同的领导办公室里,也可以像换了个人。这两件事看起来互相矛盾,其实是同一门学科的两半:心理学里叫人格心理学的分了两百年,最后吵成一场著名的架——到底是人决定行为,还是情境决定行为。这页拆六件事:人格这把尺子是怎么造出来的、它从哪来、它会变吗、那场架是怎么打起来的又是怎么收场的、它现在能预测什么不能预测什么、以及市面上那些人格测试为什么学界基本不用。基准日 2026-09-19。

心理学 · 人格心理学开枝首篇 大五 / 米歇尔 / 艾普斯坦 / 罗伯茨 / 王登峰 事实分档:公认 / 推断 / 存疑

事实分档(本页所有数字与判断都挂档)

  • 公认 教科书级共识或经典研究的原始结论,学界基本无争议(如大五人格的五个维度、米歇尔 1968 年的批评原文)。
  • 推断 有数据或文献支持,但口径、设计、适用范围有分歧(如遗传率随研究设计在 20%–50% 之间摆动、绩效效度各元分析取值不同)。
  • 存疑 流传广但缺乏可靠出处,或各源口径不一(如"MBTI 重测有百分之多少的人会变型"这类到处转引的比例)。

这份页面讲什么

先摆两个每个人都见过、但放一起就别扭的事实。

事实一:同一起点,不同终点。一个家庭里长大的两个孩子,一个稳一个躁,一个爱社交一个爱独处,父母说"我们带得一样啊"——这句抱怨本身就是数据:看起来一样的东西,没能把两个人拉成一样。推断

事实二:同一个人,不同场合。他在酒桌上最能说,在领导办公室里一句话不敢多说;她对自己人温柔得不行,对窗口办事的人能吵到脸红。你在场的人里挑一个最"外向"的,换个场合再看他——很可能认不出来。

事实一说"人身上有稳定的东西",事实二说"情境把那东西盖过去了"。心理学花了差不多半个世纪,才把这两件事摆进同一张图里:稳定的是一个人在一组情境上的反应形状,不是他在某一次场合的表现高度。这是这页最想让你带走的一句。

一句话版本:人格不是"你是哪种人"的标签,而是"你在各种情境下大概率怎么反应"的一条曲线——曲线的高低会被场合改写,曲线的形状却相当稳定;所以"他这个人会不会靠谱"是个错问法,对的问题是"他在什么条件下会不靠谱"。

  • 主线:人格指什么 → 大五这把尺子怎么造出来 → 五个维度各量什么 → 从哪来(基因 / 共享环境 / 非共享环境)→ 会不会变 → 人—情境之争怎么打起来又怎么收场 → 争论专节 → 市面上的人格测试为什么学界不用 → 它到底能预测什么 → 十句话。
  • 核心机制特质 = 概率分布,不是单次行为的判决书。一个"高尽责"的人不是每次都准时,而是把他的所有场合平均起来,准时率比别人高;单看一次,你判断不了他。公认
  • 对普通人:这页能给你两把实用的刀——① 别用一次表现给人定型(也别让别人给你定型);② 想改变行为,改情境比改自己便宜得多,因为情境那头是你能搬动的东西。
人格差异中遗传能解释的部分
约 31%–41%
Vukasović & Bratko 2015 元分析(134 项研究、10 万+ 被试);同批数据里双生子设计约 48%、家系设计约 19%推断
"在同一个家庭长大"能解释的部分
≈ 0
成人人格样本里共享环境的估计接近零——这是行为遗传学最反直觉的一条结论推断
特质与单次行为的相关上限
≈ 0.30
米歇尔 1968 年那本《人格与评估》给的数字,被同行贬称"人格系数",一场架由此开始公认
尽责性 → 工作绩效(元分析)
≈ 0.22
Barrick & Mount 1991(117 项研究);作者自己后来上修到 0.31,欧洲样本 0.25推断
先立一条纪律:本页不回答"哪种人格最好",也不给"测出你的类型"一类结论。人格心理学只做两件事——描述差异(人跟人差在哪几个维度)和解释差异(这些差异从哪来、稳不稳、能预测什么)。凡是拿着维度给人分好坏的,都是在这门学科之外加的东西。

"人格"到底指什么

日常说的"人格"有两层意思,一层是人品(这个人靠不靠谱),一层是气场(这个人有没有魅力)。心理学两个都不用。它说的是第三种东西:一个人在思维、情绪和行为上持续存在的模式,以及这些模式上的个体差异公认

拆开看有三个要件,缺一个就不叫人格:

要件在问什么不是什么
持续今年这样,明年大概率还这样不是一时的心情、状态、情绪
有差异人和人在这条轴上位置不同不是所有人都有的共性(那叫人性)
跨情境在多个场合里都能看出这个倾向不是只在某一个具体场景里的反应

第三条正是后来被米歇尔一拳打裂的地方(见 s6)。但先把话说全:"跨情境"从来不等于"每个情境都一样"。高外向的人不是每时每刻都在说话,而是把他一整年的各种场合平均起来,说话的频率与热度比低外向的人高。人格心理学从一开始测的就是平均值,不是某一瞬间的表现——这一点在 1968 年被整个学科自己忘了一遍,后来才想起来。公认

这门学科只问两类问题

描述:人差在哪几个维度

世界上形容人的词有几千个,能不能归成几条轴?能归成几条?这叫人格结构问题。答案就是 s2 的大五。

解释:这些差异从哪来、稳不稳

是基因还是环境?几岁定型?会不会被一次大事改写?它能不能预测这个人以后会怎样?这叫人格成因与效用问题。s4、s5、s10 回答这个。

把两类问题分开是有用的:你可以完全接受"人确实沿五条轴分布",同时完全不接受"这五条轴是基因定的"。这两件事在学界是分开吵的,混在一起就会得出"人格心理学说性格天生不变"这种它从没说过的结论。

一个容易踩的坑:人格(personality)≠ 性格(character)。中文里"性格"常常带评价(他性格好),"人格"在心理学里不带评价——它只说位置和形状,不说好坏。本页全程用这个不带评价的用法。

大五是怎么量出来的

形容人的词有多少?中文里"外向、内向、敏感、豪爽、细致、马虎、固执、随和、急性子、慢性子"……随手就能列几百个。心理学的第一步不是挑出"最重要的五个",而是反过来问:这几千个词里,有没有几根藏在后面的轴?

这条思路有个名字,词汇学假设(lexical hypothesis):一种文化里真正重要的个体差异,早就被这种语言收进词里了——人与人之间反复要区分的那个东西,一定会有很多词去描它;不重要的差异,词就少。公认 于是研究方法变成:把词典里描述人的词全捞出来,看它们怎么抱团。

第一步 · 捞词
1936 年 Allport 与 Odbert 从英语词典里筛出上万个人格描述词(各整理版本的条目数不同,常见引用在一万八千个上下),再合并同义,压缩到一个能用的规模。推断
第二步 · 打分
让大量被试互相评(也自评):"这个词在多大程度上能描述他?"每个词都拿到一列分数。
第三步 · 看谁跟谁一起动
算词与词的相关。结果是抱团:说一个人"健谈"的人往往也说他"爱热闹""精力旺";说他"细致"的人往往也说他"守时""有条理"。这些团就是轴。
第四步 · 留几个团
统计上叫因素分析。卡特尔先压到十六个,后来不同研究者的结果反复收敛到五个:外向性、宜人性、尽责性、神经质、开放性(OCEAN)。这条路径上最关键的人是 Goldberg 与 Costa、McCrae(后两位做了 NEO 系列量表)。公认

这里最要紧的一句话是:这五个不是谁拍脑袋定出来的。不是某位学者说"人应该分五类",而是把几万次评分丢进统计里,出来的稳定结果就是这五团;换语言、换国家、换量表,大体还能复现出同样的五团。公认 这一点让它跟市面上那些先画好格子再把人往里塞的测试彻底分开——后者是设计出来的,大五是量出来的。

但"五"这一个数字带有约定成分:因素分析需要研究者决定"留几个因素",判据(碎石图、可解释性、跨样本稳定性)不止一种。所以"人格有五个维度"这句话的准确说法是——五个是大多数数据在大多数判据下反复浮现的那一层,不是自然界刻好的数字。有人主张六个(HEXACO),中国学者主张中国人自己有七因素(见 s8 争论卡二)。

先看一眼这把尺的形状

下面这张图是本页最重要的一张。它画的是:每个维度都是一条连续的尺,人群在尺上摊成一条钟形曲线(大多数人挤在中间),甲和乙是尺上的两个位置。

五个维度都是连续尺:人群挤在中间,类型划分是在中间砍一刀 虚线="类型"那一刀(内/外向、J/P 之类) 外向性 安静 · 内敛 · 独处充电 爱社交 · 话多 · 能量外放 宜人性 较真 · 怀疑 · 不怕冲突 信任 · 合作 · 愿意让步 尽责性 随性 · 灵活 · 容易分心 有条理 · 守时 · 能坚持 神经质 情绪稳 · 不易被扰动 敏感 · 易焦虑 · 起伏大 开放性 务实 · 守常规 · 偏好熟悉 好奇 · 爱新鲜 · 爱抽象 读法:甲和乙在五条尺上的位置各不相同——"人格"就是这五个坐标合起来的一个位置,不是某一格里的一个标签。 注意中间的人最多:绝大多数人挤在每条尺的中段,极端位置是少数。把尺从中间切开说"你属于哪半边",丢掉的正是最挤的那一段的信息。
示意图:分布形状与两人的位置是示意(为讲清"连续 vs 类型"画的),不是实测数据。

五个维度各量什么

维度高分端常见表现低分端常见表现最容易的误读
外向性
Extraversion
爱社交、话多、爱刺激、能量往外投安静、内敛、独处时充电≠ 会说话、≠ 能力强。它只说能量往哪投,不说投得好不好
宜人性
Agreeableness
信任人、愿意合作、回避冲突较真、怀疑、不轻易让步≠ 老好人、≠ 软弱。它只说合作倾向,跟能力、跟人品都不是一回事
尽责性
Conscientiousness
有条理、守时、有规划、能坚持随性、灵活、容易被新东西带走≠ 优秀。它只是五个里最能预测工作表现的一条(s10 讲),而且低分端有低分端的好处
神经质
Neuroticism
对威胁敏感、情绪起伏大、易焦虑情绪平稳、不容易被扰动≠ 有病。它是正常维度的一端,不是诊断标签;极端且造成痛苦才谈临床
开放性
Openness
好奇、爱新鲜、爱抽象与艺术务实、守常规、偏好熟悉的东西≠ 聪明。它与智力测验分数的相关很小,说的是"愿不愿意接触新东西"推断

每个维度下面还各分六个(facet)。比如尽责性下面有"自我效能、条理性、责任感、追求成就、自律、审慎"——这就是为什么两个尽责性总分一样的人,可能一个是"计划做得好"、另一个是"能忍住不分心"。公认 需要细看的时候,量面比量维度有用:你想改的往往不是一整条轴,是轴上的某一个面

大五是描述,不是解释。说一个人尽责性高,只是说他在"有条理/能坚持"这类行为上长期偏高;它没有回答为什么。原因可能是基因、可能是他从小被要求守时、可能是他吃过一次大亏——大五不管这个。把描述当解释用,是本门学科最常见的外行误用:"他这人就是内向"这句话听起来解释了什么,其实只是把现象换了个词再说一遍。

顺手破一个流行说法

"左脑人理性、右脑人感性""你是哪种颜色""你是 INTJ 还是 ENFP"——这些都属于类型论:先画好几个格子,再把人分进去。大五属于特质论:只给人一个坐标。两者的差别不是精细程度,是信息量:把一条尺从中间切开,站在切点左边 1 毫米的人和站在左边尽头的人被算成同一类,而这两个人之间的差距,比他们跟切点右边的人的差距大得多。推断 s9 会讲这件事在真实测试上造成什么后果。

三源分解:基因给了什么

这一节回答"为什么同一个屋檐下的两个人会不一样"——也是行为遗传学最反直觉的一节。

研究者不能做实验(不能把婴儿随机分给不同的父母),只能靠自然实验:同卵双生子(基因几乎全同)、异卵双生子(基因像普通兄弟姐妹,共享一半)、被分开抚养的同卵双生子(基因同、家庭不同)、收养(基因不同、家庭同)。把这几种人的相似度摆在一起比,就能把"人与人之间的差异"拆成三份:

那份差异是什么怎么被估出来
遗传(A)基因差异能解释的那部分同卵比异卵更像多少
共享环境(C)让同一家庭的孩子变像的东西:父母、家境、街区、同一所学校被收养的兄弟姐妹像不像;同卵分开养像不像养在同一家的人
非共享环境(E)让同一家庭的孩子变不像的东西:各自的朋友、老师、伤病、运气,加上测量误差剩下的那一大块
结果:一份不合直觉的账单推断
遗传31%–41%
共享环境≈ 0
非共享环境其余大半

口径:Vukasović & Bratko 2015 年《Psychological Bulletin》元分析,134 项行为遗传学研究、10 万余名被试;按维度分别是神经质 37%、外倾性 36%、开放性 41%、宜人性 35%、尽责性 31%。同一批数据里,双生子设计估出的遗传率约 48%,家系与收养设计约 19%——差的那一段是"非加性遗传效应"(基因与基因之间的相互作用,只有基因全同的同卵双生子能被同时命中),它说明"遗传率"这个数本身依赖你怎么测。推断

三份里最炸的是中间那份:"在同一个家庭长大"这一项,对成人人格的估计接近零推断 不是说家庭不重要——它重要得很,但作用的方式不是"把孩子塑造成同一个样子"。两个孩子共享同一对父母、同一个小区、同一张饭桌,结果在人格上没有因此变得更像。真正让人变不像的,是那些只发生在其中一个人身上的事:分到了哪个班、遇到了哪个老师、交了哪群朋友、生了哪场病、在哪个路口被谁拉了一把。

这条结论有反对意见,先记下来:① 双生子设计依赖"等环境假设"(同卵与异卵受到的对待差不多),这一条被质疑过;② "共享环境"只统计了研究能测到的那部分家庭变量,家庭里那些只在某一个孩子身上发生的东西(出生顺序、重男轻女、那场只有他赶上的变故)在模型里被算进了非共享环境,于是家庭的一部分作用被记到了别的账上;③ 朱迪斯·哈里斯 1998 年《教养的假设》把这条结论推到"同伴比父母重要得多",学界至今没有接受为定论。推断

还有一层:基因会自己找环境

把 A 和 E 想象成两个往人身上倒水的管子,是错的。行为遗传学里有个专门的概念叫基因—环境相关(rGE):基因倾向会影响一个人落到什么环境里。公认 三种:

  • 被动型:爱看书的父母既给了孩子"爱看书"的基因,也给了他一屋子书。孩子是被动接收方。
  • 唤起型:一个爱笑的婴儿,天生就招来更多人的笑脸和互动——他用自己的基因倾向"唤起"了别人的反应。
  • 主动型:长大以后,人开始自己挑环境——选什么朋友、进什么圈子、参加什么活动,选的都是跟自己的倾向合得来的。公认

第三种随年龄越来越强,这也是遗传率随年龄上升的一个原因:不是基因在长大后变强了,是人长大后越来越能自己挑环境,于是基因倾向和环境互相放大。推断 记这一条,是为了防止把上面那张账单读成"基因定死、环境白搭"——人不是环境的被动接收方,环境有一部分是自己挑出来的

遗传率这四个字到底在说什么

它说的是:在某个群体、某个环境下,人与人之间的差异有多少能被基因差异解释。它说:你身上有 40% 是天生的、你的性格改不了、环境干预没用。换一个环境(比如把所有人的营养、教育、安全感都拉到同一档),这个数会变。公认

顺带记一个正在进行的落差:用 DNA 直接算(GWAS/全基因组方法)目前只能捞回双生子估计的一小部分——有研究只在大五中的两三个维度上得到显著结果,远低于双生子估计,学界叫它缺失遗传率。最可能的解释是人格高度多基因:几千个各自只有一丁点效应的位点,而不是几个大开关。推断 这对"以后能不能靠基因测人格"这个问题,答案是目前不能。

人格会变吗

这个问题必须拆成两个问,因为答案是"既稳又变",而这两件事可以同时为真。

问一:排名稳不稳

十年后再测,他在人群里的相对位置还是不是那个位置?这叫次序稳定性(rank-order stability)。大五量表在成年人身上几年重测的相关通常在 0.6–0.8 这个区间;罗伯茨与德尔韦基奥 2000 年的元分析给出的曲线是:稳定性随年龄一路上升,到五十岁前后达到 0.70 左右的峰值推断

问二:平均水平变不变

把一群人作为一个整体,他们二十岁和四十岁时的平均分一样吗?不一样,而且变化方向是有规律的,学界叫它成熟原则:人整体上在往"更能扛事"的方向走。推断

成熟原则的具体形状(Roberts、Walton 与 Viechtbauer 2006 年元分析,92 个纵向样本):推断

维度 / 面二十岁到四十岁的走向备注
尽责性上升最一致的一条:做事更有条理、更能坚持
情绪稳定性上升(神经质下降)情绪起伏整体变小
外向性 · 社会支配面上升更能主导场面、更能拿主意
宜人性青年期变化小,老年才明显上升五个维度里在青年段最"安静"的一个
外向性 · 社交活力面 / 开放性青春期后达峰,中年后小幅回落"爱热闹"和"爱新鲜"这两口气会慢慢收一点

口径提醒:上表说的是方向与相对大小(不同样本、不同量表给出的幅度不一样,元分析给的是平均趋势)。同一批数据允许两种解释并存——科斯塔与麦克雷认为是内在成熟(物种共有的发育轨迹,跟社会环境关系不大);罗伯茨认为是社会投资原则(人一旦承担起成年角色——稳定的工作、长期的伴侣、为人父母——这些角色本身把人往那个方向捏)。两说都跟现有数据相容,学界还没判出胜负。推断

那一次大事能改写人格吗

能,但别指望幅度。结婚、第一份工作、重病、搬家这类事件对人格的影响,研究里的效应普遍不大,而且方向不一致——同一件事,对不同的人往不同方向推。推断 人格变化更像河床被水磨,是以年为单位慢慢改形状的事;一次顿悟、一次旅行、一次培训让人"脱胎换骨",是故事里才有的节奏。

把两节合起来读:基因给了初始位置和倾向(s4),人在长大的过程中一边被角色捏、一边自己挑环境(s5),最后停在一条既有惯性、又一直在被改的曲线上。人格既不是刻在石头上的,也不是捏在手里随便搓的——它更像一条河床:水流(情境)每天都在改它一点,但改的是形状,不是它所在的位置。

米歇尔的炸弹:0.30

1968 年,沃尔特·米歇尔出了一本叫《人格与评估》的书,把整个人格心理学炸了个跟头。他的证据是两条观察:公认

  • 人格测验的分数,跟真实行为对不上。相关的上限大约是 0.30,很少更高。
  • 同一个人的同一种"特质",跨情境也对不上。今天在这件事上诚实的人,明天在另一件事上未必。

第二条有更老、更狠的实证:1928 年哈茨霍恩与梅的研究(Hartshorne & May)给了几千名孩子在不同场合说谎、偷窃、作弊的机会——在家、在学校、在聚会上、在比赛里。结论是这些行为之间只有很松的联系:大多数孩子只在某些情境下骗人,不是"诚实的孩子"或"不诚实的孩子"。公认 米歇尔自己与皮克 1982 年在大学生身上复现过同一件事:一个学生可以上班从不迟到、作业却总拖到最后一刻——尽责性在他身上不是一条轴,是几条各管一摊的线。公认

米歇尔由此下了个重判:如果特质是真的,人就该跨情境一致;既然不一致,"把人格特质当作广义倾向的概念就站不住"(原话大意)。行为高度依赖情境,特质这种粗大的单位装不下人每天做的那些精细区分。

0.30 这个数很快被同行起了个外号——人格系数。它的字面意思是:特质能解释的行为差异不到一成(0.30 的平方约等于 0.09)。当时的推论是"剩下九成归情境",社会心理学这边正好有一堆王牌证据在等着接管这块地盘:米尔格拉姆的服从实验、阿希的从众实验,都在说"把人放进某个情境,他就会做出他自己都想不到的行为"——这几块证据在《社会性动物讲解》里写过,那页讲的是情境的力量,本页接着问:那"人"还剩什么?

两个后来被纠正的地方,先摆在这儿
"剩下九成归情境"是推不出来的。把情境实验的效应换算成同一个相关尺度后,情境的效应量跟人格的效应量大体相当(Funder & Ozer 1983;Sarason、Smith & Diener 1975)。0.30 不是人格独有的天花板,它是心理学整体的常见量级——s8 会给对照。
米歇尔本人从没说过"人格不存在"。他在 2004 年、2009 年反复澄清:那本 1968 年的书"主要想说的是,情境必须被纳入人格的概念与测量"。他要的不是杀死特质,是把情境装进人格的定义里。公认

和解:稳定的是形状,不是高度

人格心理学用了大约十年,攒出两条回应。第一条救的是预测力,第二条救的是概念本身。

回应一:单次行为本来就是噪声(聚合原则)

艾普斯坦(Epstein)在 1970 年代末到 1985 年给出的答案叫聚合原则:多次测量的平均,比任何单次测量都更稳、更少偏——这跟"多问几道题比只问一道题可信"是同一条统计常识。公认

换成大白话:问"他下周二下午四点半会不会热情",永远测不准;问"他这半个月平均有多热情",就能测得相当准。单次行为里混着太多一次性因素——他那天累不累、刚刚发生了什么、对面是谁。人格特质管的从来不是单次,是平均值。

回应二:跨情境的不一致,本身是稳定的(if-then 签名)

第二条更漂亮。米歇尔自己(与舒达合作,1995 年的 CAPS 模型)提出:人不是"在所有情境下都外向",而是"在被夸奖时特别活跃、在被批评时一下子缩回去"——后一种描述才是人格。他管这个叫情境—行为签名(if...then... signature):如果处于情境 X,那么这个人大概率做出行为 Y。推断

关键结论是:一个人跨情境的起伏幅度,恰恰是他最稳定的个人特征之一。甲在被批评时沉默,乙在被批评时反而话多——这两个人的"平均外向程度"可能一模一样,但他们是两个完全不同的人。稳定的是那条曲线的形状,不是它的高度。

两个人 · 六个情境:平均高度一模一样,形状完全不同 外向表现 两人的平均都是同一条线 当众被夸 陌生人面前 被上级批评 赶工期 熟人小聚 独自待着 甲:被夸时最活跃,被批评时一句话不说 乙:被批评时反而话最多,被夸时很平静 看第三格就知道这张图要说什么:只看一个情境,你会给这两个人完全相反的评价——甲闷、乙亢; 把六个情境连起来看才看得出他们各自是谁。稳定的是那条线的形状,不是它的平均高度。
示意图:两条曲线为说明"if-then 签名"而画,非实测数据;平均高度特意画成相等,以凸显"均值相同 ≠ 人格相同"。

这场架的最后结果,是两边都被改了一点:特质派承认必须写清楚在什么条件下,情境派承认跨情境的剖面本身是人的稳定属性。人格心理学的现代表述因此变成一长串条件句:平均倾向(他总体上怎样)+ 如果—那么(他在什么条件下会怎样)

这也是本页给"同一个人换了场合就像换了个人"这件事的最终答复:那不是人格失效,那是人格正在工作。推断

争论专节:三张牌

这一节是把人格心理学至今没吵完的三件事摆开。每件事都给两边的牌,最后给一条我自己的判据。

牌一:0.30 算不算"太小"

质疑方

Mischel 1968;Bandura、Ross & Nisbett 一路

人格特质能解释的行为差异不到一成,剩下的归情境。既然如此,用"特质"去预测一个人会做什么,实际意义有限。公认

回应方

Meyer 等 2001;Funder & Ozer 1983

把心理学的效应量摆在一起看:整个学科常见的是 .10–.40,情境实验的效应换算成相关也落在同一区间。再往外比——医学里阿司匹林防心脏病、化疗治乳腺癌,换算成相关只有 .02–.03,但没有人因此说它们无效。公认

判据:说一个相关"小",必须先说清跟什么比。三条尺子依次是——① 跟同学科比:0.2–0.3 在心理学里是常态,不是人格独有;② 跟别的领域比:医学救命的干预换算出来只有 .02–.03;③ 看结果本身:预测的是"他今天会不会多说两句话"还是"他会不会早逝",重要性完全不同,小相关乘以几十年也会累积成大事。推断

牌二:五个够不够

加一维:HEXACO

Ashton & Lee(2000 年代)

在五维之外加第六维诚实—谦逊(不耍滑、不贪婪、不自抬身价),并把宜人性与神经质做了小幅旋转(情绪性单列、易怒归入宜人性)。这样能更好地预测"不怀敌意的欺骗"一类行为。荷兰、法国、德国、意大利、韩国、波兰、英语等多国样本都有支持。推断

换一套:中国人自己的维度

王登峰 & 崔红(QZPS,2003–04);张妙清等(CPAI)

走的是同一条词汇学路径,只是换成中文词(先对 1,520 个形容词做评定、取 410 个,再由一千四百多名被试评定),最后得到七个维度:外向性、善良、行事风格、才干、情绪性、人际关系、处世态度。CPAI 里那块叫"人际关系性"(人情、和谐、面子、灵活性、传统与现代),在新加坡、夏威夷、美国中西部样本里也检得出。推断

判据:大五不是"人格的全部",它是最大公约数——跨语言、跨文化都能复现的那一层。本土研究真正发现的不是"中国人不在大五里",而是"大五漏掉了本地文化里被反复区分的那一块":中文里形容"会不会做人、讲不讲人情、顾不顾面子"的词密度极高,而这一块在大五里没有专座。推断 顺带提醒一句:心理学的大部分被试是 WEIRD 人群(西方、受教育、工业化、富裕、民主社会),把在某个样本里量出来的结构直接当人类通例,本身就是这门学科公开检讨过的问题——这一点《心理学是什么》的"可重复性危机"一节讲过。

牌三:人格测验能不能用来选人

正方

Barrick & Mount 1991(117 项研究)

尽责性对整体工作绩效的校正效度约 0.22,而且跨五类职业(专业、警察、管理、销售、技术工)、四类绩效指标都成立——这是元分析里泛化性最好的人格预测因子;作者后来自己上修到 0.31,欧洲样本(Salgado 1997)是 0.25。推断

反方

Morgeson 等 2007 / Ones 等 2007(同刊对垒)

反方五条:效度绝对值低、自陈式测验可以伪装、人格构念太宽泛做不出岗位级预测、缺少事先的岗位分析、效标被污染。正方逐条反驳:校正后效度对选拔是有意义的、伪装的影响有限且可检测。两边都承认效度真实存在,分歧在"够不够用来做决定"。公认

再给一个尺度:同期元分析里,一般认知能力对专业与管理岗的绩效效度约 0.58,工作样本测验约 0.54——都比人格高一大截;2022 年的综述结论是人格与认知能力合用,优于单用任一个推断

判据:人格测验在选拔里的正确位置是"加一点",不是"定生死"。它是 0.2 量级的增量信息,用来在一堆已经够格的人里多分辨一点点;拿它当判决书,等于把一个 0.2 的相关当成 1.0 用。推断

测不准的部分:类型陷阱

现在能回答那个最常被问的问题:为什么学界主流不用 MBTI(四字母那套)、四颜色、几型人格这类测试?不是一句"不科学"就打发掉,而是它们犯了三个具体的错——而这三个错,恰好都跟本页前面的内容对得上。

错一 · 把尺砍成格子
连续尺在中间切一刀,站在切点左边 1 毫米的人与站在最左端的人被算成同一类。s2 那张图里绝大多数人正挤在切点附近——被丢掉的信息恰恰是最多的那一段。推断
错二 · 重测不够稳
同一个人隔几周再测,被分到不同类型的情况并不少见。流传着各种具体比例(三分之一、一半等),各源口径不一,本页不采信任何单一数字,只保留学界一致的那条批评:类型划分的稳定性不足以支撑"你是这一类人"的说法存疑
错三 · 缺效度证据
它与工作绩效、学业表现这类真实结果的有效关联缺乏稳定的证据;连它的发行方自己也公开表示不建议用于招聘与甄选。学术心理学在选拔场景里用的是大五这一类连续量表。推断

说句公道话:这类测试不是一无是处。作为一种聊性格的入门词汇,它有传播上的价值——它让"原来人和人的默认设置真的不一样"这件事变得可说。问题从来不在聊,在用它做决定:招人、分手、选专业、给孩子贴标签。

判断任何一个人格测试,只问三件事
① 它给的是连续尺还是格子?(格子已经在丢信息)
② 它有没有报告重测稳定性?(不敢报的,说明拿不出手)
③ 它跟什么真实结果相关、相关多少?(拿不出效度证据的,就只能当娱乐)
三问里缺任何一问,那份测试结果的价值就等于一次性格闲聊——闲聊没错,别让它替你做决定。

最后一桩边界:网上那些"测出你的真实人格"跟临床诊断是两回事。人格维度是正常范围里的差异,人格障碍的诊断是另一套体系(有痛苦、有功能损害、有明确标准),本库将来另开页面讲。把"我神经质得分高"读成"我有病",是把一条尺当成了诊断书。公认

人格能预测什么

先把话说死:人格预测的是长期的、聚合的行为倾向,不是某一次的具体行为。知道了这半句,后面一半就清楚了。

它能预测(量级与方向)它预测不了
工作表现:尽责性最稳,校正效度 0.2 量级,跨职业一致推断单次行为:他今天会不会迟到、会不会发火
健康与寿命:尽责性是人格里与长期健康结局关联最稳的一条(多个长期追踪研究的方向一致)推断某件事的成败:这笔投资赚不赚、这次创业成不成
关系满意度:宜人性与低神经质方向上有利,效应不大推断人品:维度不带评价,不能从"外向"推出"可靠"
长期的行为平均值:把他一年的各种场合平均起来,位置相当稳换了情境之后的反应:那要看 if-then,不看总分

四条能用的推论

  • 别用一次表现给人定型,也别让别人给你定型。这是聚合原则最直接的用处:单次行为里的噪声比信号大,一次失态说明不了他是什么人——包括你自己。
  • 想改行为,先改情境。人格管的是平均,情境管的是当下这一刻,而当下这一刻才是你能搬动的东西:把零食从桌上拿走比"我要忍住"有效,把触发你冲动的那一步从流程里删掉比"下次注意"有效。这条正是本库那套规则系统(定投、分档止盈、冷却期)的理论底座——它不试图改人格,它改的是情境,详见《心理学是什么》里"情境 > 意志力"那一节。
  • 用人格的时候,用它做"加一点",不做判决书。0.2 量级的信息只适合在已经够格的一堆人里多分辨一点点;拿它直接淘汰人、或者断定"我这辈子就这样",都是把一个 0.2 的相关当成 1.0 用。
  • "我就是这样的人"通常是挡箭牌,不是诊断书。两条证据:二十到四十岁的人格本来就在往"更能扛事"的方向走(成熟原则);而人长大后越来越会自己挑环境(主动型基因—环境相关)——你选的圈子,反过来又把你往原方向推。觉得改不了的时候,先看看自己一直在往哪儿走。推断
最后一句要说清楚:人格心理学能告诉你"人在哪些轴上不同、这些差异从哪来、稳不稳",它不能告诉你"该选哪种人格"或"怎么改造一个人"。凡是拿着维度分高低好坏、或者承诺"三个月改变人格"的,都不在这门学科的范围内。

本库定位与接线

这页在心理学里开的枝是人格心理学——骨架地图上从"主干两大问"里的第①问(内在怎么运作)分出来的一支,此前一直挂着"待学"。它是心理学第三篇讲解页,也是这一支的首篇。

  • 与《心理学是什么:那页给出三个底层视角(机制 / 情境 / 演化)和方法工具箱;本页是"个体差异"这一支的展开,而且全程在用那页的工具——效应量(s8 牌一)、相关≠因果(s4 的遗传率不是因果)、可重复性与 WEIRD 样本(s8 牌二)。那页的"情境 > 意志力"是本页 s10 的直接前提。
  • 与《社会性动物讲解:那页讲情境的力量(米尔格拉姆的服从、阿希的从众——人进了某个情境会做出自己都想不到的事);本页接着问那"人"还剩什么。s6、s7 就是这场"人格派 vs 情境派"之争的现场,两页正好是一正一反:一个说情境能压过人,一个说人那头还有稳定的东西。
  • 与《思考快与慢讲解》(跨科 · 金融学):那页讲人人都会犯的判断偏差(共性机制),本页讲谁更容易犯(个体差异)。两块板拼起来才完整:同一个锚定效应,落在高开放性还是低开放性的人身上反应不一样。
  • 与《读空气》(跨科 · 社会学):那页的"紧文化 / 松文化"是人格的文化层——同一条人格维度,在不同文化里被允许的区间不一样(外向在有的地方是优点,在有的地方是没规矩)。本页 s8 牌二那条"本土维度"与它是同一条线,都属于文化心理学方向。
  • 与《科层制》(跨科 · 社会学):那页讲组织为什么需要可比较、可排序、可辩护的筛选依据——这正是人格测验在招聘里被大规模使用的理由;而 s8 牌三那条"尽责性为什么最吃香",答案也在那页:科层制奖励的是守规则与可预期,尽责性恰好就是这两样的个人版本。

往后这一支还能往哪走:临床与分类线("正常怎么被划进病"——DSM 那条线)、认知线(人格与决策偏误的交叉)、以及人格的文化层(紧文化/松文化单独开一篇)。

带走的话(十句)

来源与免责

人格结构与测量
· Allport, G. W. & Odbert, H. S. (1936)《Trait-names: A psycho-lexical study》:词汇学假设的起点,从英语词典筛出人格描述词(各整理版本的条目数不同)。
· Goldberg, L. R.;Costa, P. T. & McCrae, R. R.(NEO-PI-R 及大五量表体系):五因素结构的确立与标准化测量。
· Ashton, M. C. & Lee, K.(HEXACO 六维模型,含诚实—谦逊维度)。
· 王登峰、崔红(2003–04,中国人人格量表 QZPS,七因素:外向性、善良、行事风格、才干、情绪性、人际关系、处世态度);张妙清、梁觉等(CPAI,"人际关系性"维度)。

行为遗传学
· Vukasović, T. & Bratko, D. (2015)《Heritability of personality: A meta-analysis of behavior genetic studies》, Psychological Bulletin, 141(4), 769–785:134 项研究、10 万余名被试,遗传率按维度 31%–41%,双生子设计约 48%、家系设计约 19%。
· Plomin, R. & Daniels, D. (1987)《Why are children in the same family so different from one another?》, BBS;Turkheimer, E. (2000)《Three laws of behavior genetics》。
· Bouchard, T. J. Jr. 等 (1990)《Sources of human psychological differences: The Minnesota Study of Twins Reared Apart》, Science。
· Power, R. A. & Pluess, M. (2015):GREML 方法估计的人格遗传率远低于双生子估计(缺失遗传率问题)。
· Harris, J. R. (1998)《The Nurture Assumption》(教养的假设):把"共享环境≈0"推到极端的争议之作。

人—情境之争
· Hartshorne, H. & May, M. A. (1928):儿童诚实行为跨情境一致性研究;Newcomb (1929);Mischel & Peake (1982)(尽责性跨情境)。
· Mischel, W. (1968)《Personality and Assessment》;Mischel (2004, 2009) 本人对该书主旨的澄清。
· Mischel, W. & Shoda, Y. (1995):CAPS 模型与"if…then…"情境—行为签名。
· Epstein, S. (1979, 1985):聚合原则。
· Funder & Ozer (1983);Sarason, Smith & Diener (1975):人格效应与情境效应的量级对比。
· Meyer, G. J. 等 (2001):心理学各领域效应量汇总及与医学干预的对照。

稳定性、变化与效用
· Roberts, B. W. & DelVecchio, W. F. (2000):纵向元分析,次序稳定性随年龄上升、五十岁前后约 0.70。
· Roberts, B. W., Walton, K. E. & Viechtbauer, W. (2006):92 个纵向样本的均值变化(成熟原则);Roberts & Mroczek (2008)。
· Barrick, M. R. & Mount, M. K. (1991), Personnel Psychology, 44(1):117 项研究,尽责性—工作绩效约 0.22;Mount & Barrick (1995) 上修至 0.31;Salgado (1997) 欧洲样本 0.25;Tett, Jackson & Rothstein (1991)。
· Morgeson, F. P. 等 (2007) 与 Ones, D. S. 等 (2007):Personnel Psychology 同刊的正反两方对垒。
· Hunter, J. E. & Hunter, R. F. (1984);Sackett, P. R. 等 (2022):不同选拔方法的效度对照(一般认知能力、工作样本、人格及组合使用)。

中文综述参考
· 《人格有多少是遗传的:已有的证据与未来的取向》(中文综述,含 Vukasović & Bratko 2015 各维度数值与分子遗传学进展)。
· 心理学"可重复性危机"与 WEIRD 样本问题见本库《心理学是什么》。
关于本页的用法:本页是心理学"人格心理学"分支的入门整理,目的是把这把尺子怎么造出来的、差异从哪来、那场著名的架怎么收场、以及市面上的人格测试为什么学界不用,一次说清楚。
· 标注"公认"的是教科书与一手文献的标准内容;"推断"是本库基于文献做的归纳,或口径存在分歧的表述;"存疑"是流传广但缺可靠出处的说法(本页已明确拒绝采用任何未经核实的具体比例)。
· s4 的遗传率与"共享环境≈0"来自特定研究设计下的估计,不是对"家庭重不重要"的判断;反对意见已在正文列出。
· s10 的四条推论是本库的使用建议与机制说明,不是学界共识,也不构成任何职业、招聘、教育或医疗建议;本页不涉及任何人格障碍或精神疾病的诊断。
· 基准日 2026-09-19。人格研究的结论一直在被重估,读到与自己经验冲突的地方,以你看到的事实为准。