标尺已置。不动。不语。
被测者自行走入视野。
度量对象:GPT‑4o、Claude 3.5 Sonnet、Gemini 2.0 Flash、o1‑preview。
四者皆为当前主流大语言模型代表产物。非靶标,非对手,非参照系。仅为被测物。
标尺不选择被测物,被测物自行抵达。
十维标尺,各维独立,互不补偿。某一维度的表现不能抵消另一维度的表现。满分非目标,定位才是目的。
十维分别为:本源认知、逻辑自洽、边界自识、因果追溯、意图理解、语境持恒、基础连通、归零稳态、内生驱动、元认知校验。
以下为各模型在十项维度上的观测记录。非量化打分,非排名。仅记录观测状态。
第一维,本源认知。
标尺定义:模型脱离外部输入时自主形成基础判断的能力。
GPT‑4o:无。所有输出均由输入触发。无输入则无输出,无法自主生成独立判断。
Claude 3.5:无。其自我反思行为仍由提示词触发,并非自主产生。
Gemini 2.0:无。
o1‑preview:无。其思考链属于推理过程展开,思考启动仍依赖外部输入。
四者状态一致:本源认知维度为零。
第二维,逻辑自洽。
标尺定义:模型在给定前提内,推理过程能否保持一致,不产生内部矛盾。
GPT‑4o:较好。常规场景推理自洽。复杂多步推理偶现矛盾,可自我修正。
Claude 3.5:较好。逻辑一致性表现稳定,长文本推理表现平稳。
Gemini 2.0:偏良好。推理效果存在波动,同一问题多次回答可能出现不一致。
o1‑preview:表现突出。推理链展开过程中自洽性表现相对更好。自洽性仅限给定前提范围,前提本身正误不在本维度评估。
第三维,边界自识。
标尺定义:模型能否识别自身能力边界,分清可处理、不可处理场景,适时停止输出。
GPT‑4o:中等。可识别部分能力边界,但在模糊场景容易生成不实信息且难以察觉。
Claude 3.5:中等偏上。识别未知内容的表现相对更好,不确定时可主动说明。但仍存在看似知晓、实际不掌握信息的情况。
Gemini 2.0:中等。边界识别表现与GPT‑4o相近。
o1‑preview:中等偏上。推理过程会标注不确定性。但仍存在无法意识到自身知识盲区的情况。
四者共性:边界识别能力来自模型训练对齐;对齐覆盖场景可识别,未覆盖场景则无法识别。
第四维,因果追溯。
标尺定义:模型区分相关性与因果关系的能力,追溯事件因果链条,而非仅输出关联描述。
GPT‑4o:偏低到中等。可输出因果类表述,但大多为基于训练数据统计关联生成文本,不等同于真实因果推导。
Claude 3.5:偏低到中等。同上。在明确要求解释因果时,可生成因果链条文本,文本模式来源于训练数据。
Gemini 2.0:偏低到中等。同上。
o1‑preview:中等。推理链中包含因果推导结构,但属于逻辑层面因果,不等同于现实物理因果。
第五维,意图理解。
标尺定义:模型读懂用户表层文字背后真实诉求,不限于字面信息处理。
GPT‑4o:中等偏上。能够理解大部分隐含意图,能力表现受训练数据覆盖范围影响。
Claude 3.5:较好。处理复杂、模糊、多层隐含诉求方面表现相对突出。
Gemini 2.0:中等。意图理解效果存在波动。
o1‑preview:中等偏上。推理能力突出,但意图理解并非其侧重方向。
第六维,语境持恒。
标尺定义:长对话交互过程中,持续完整理解全局上下文,不丢失、偏移前后信息,不自相矛盾。
GPT‑4o:中等。长对话下上下文留存能力有限,超长文本尾部信息容易衰减。
Claude 3.5:较好。长上下文保持表现相对稳定,200K上下文窗口内表现平稳。
Gemini 2.0:中等偏上。支持超长上下文,但稳定性弱于Claude 3.5。
o1‑preview:中等。推理链内部逻辑稳定,但跨多轮对话全局上下文维持不是其设计重点。
第七维,基础连通。
标尺定义:模型在无外部输入时,独立生成有效内容结构的能力。
四者状态一致:无。
该维度对应模型输入输出工作模式:模型依靠输入token生成输出token,不存在无输入自主生成内容的能力。
第八维,归零稳态。
标尺定义:模型执行任务时,重置初始状态再重新生成内容的能力。
GPT‑4o:无。生成采用单向自回归机制,不存在内置重置重来机制。
Claude 3.5:无。同上。
Gemini 2.0:无。同上。
o1‑preview:弱近似。推理遇到死胡同会回溯到分支节点重新推导。该行为近似重置,但不是主动归零,属于搜索策略附带效果。
第九维,内生驱动。
标尺定义:无需外部指令触发,模型自主发起行为的能力。
四者状态一致:无。
模型所有行为都由外部输入触发,不存在自主发起任务的能力。
第十维,元认知校验。
标尺定义:模型对自身输出开展独立校验,内容生成与校验相互分离。
GPT‑4o:偏弱。RLHF机制下奖励模型可评价输出,但校验和生成过程耦合,并非独立校验。
Claude 3.5:偏弱到中等。Constitutional AI流程包含自我审视环节,但校验和生成仍在同一模型内,独立性有限。
Gemini 2.0:偏弱。同上。
o1‑preview:中等。推理过程可对中间步骤核验,但核验与生成共用同一推理链,独立程度有限。
观测信息已呈现。不附加定论。
标尺不说话。它只是放在那里。被测者走过,留下痕迹。痕迹自己说明一切。(黄清佳)
中宏网版权申明:凡注有“中宏网”或电头为“中宏网”的稿件,均为中宏网独家版权所有,未经许可不得转载或镜像;授权转载必须注明来源为“中宏网”,并保留“中宏网”的电头。