各个大语言模型整理物理碗题集精简版比较
关于几个大模型在推理以及物理方向应用的全主观、不客观测评。
之前整理的757页物理碗分类题集有点太长了,想着还是缩短一些比较好,同时也可以做成Anki卡片的形式,方便刷题,于是开始精简计划。
基本思路是把已有内容挨着一道一道题放进大模型,让其根据输入的题目和解答,重新输出精简版答案。使用的大模型都从OpenRouter上调API来跑。参赛选手如下(费用和延迟会有波动):
| 模型 | 输入价格 $/M Token | 输出价格 $/M Token | 延迟 s |
|---|---|---|---|
| o1-mini | 1.1 | 4.4 | 0.72 |
| DeepSeek-R1 | 0.8 | 2.4 | 0.73 |
| Claude Sonnet | 3 | 15 | 1.38 |
| Gemini Flash 2.0 | 0.1 | 0.4 | 0.59 |
DeepSeek-R1官方费用是0.14 in / 0.55 out,但太火了,官方API延迟达到19.71s,于是用了加速版本。
精简结果:页数
精简前757页,精简后如下。整体来看差不多,各模型基本都能达到精简要求。
| 模型 | 精简后页数 | 缩减页数 |
|---|---|---|
| o1-mini | 488 | 269 |
| DeepSeek-R1 | 507 | 250 |
| Claude Sonnet | 459 | 298 |
| Gemini Flash 2.0 | 477 | 280 |
精简内容对比
挑一道相对论比较难的题目举例,以下是原题和详细解答:
o1-mini:
DeepSeek-R1:
Claude Sonnet:
Gemini Flash 2.0:
整体来看,各模型都能基本完成任务,但各有侧重——GPT-o1-mini最简练,Gemini给出了完整计算过程,DeepSeek信息比较全面,Claude可能最符合我的解题习惯。
LaTeX编码问题
比较出乎意料的是,尽管Claude Sonnet在其他编程任务中基本是OpenRouter排名第一的模型,但在LaTeX编码中会出各种神奇的错误,以至于输出后我不得不另外写程序让ChatGPT给Claude修改LaTeX编译错误。GPT-o1-mini和Gemini在LaTeX方面表现不错,几百道题每个模型大概只有5个左右的小错误需要手动修正。
DeepSeek的问题在于:即使要求不输出思考过程,它还是会在很多题目中把思考过程写出来,而且思考过程不是LaTeX格式,所以需要花大量时间修正。这个问题会集中出现在某一章的题目中。此外,循环前半段DeepSeek并没有按要求完成任务,而是直接把输入内容原封不动地输出——到中间某个节点才突然开始按要求精简,导致第一版高达636页,后来又重跑了一遍才得到结果。
Gemini有些题目的输出极其内敛,只给公式不给文字说明,不知道是不是训练了太多学生作业。
综合性能数据(10题测试)
| 模型 | 平均耗时 s | 平均输出长度 | 最短 s | 最长 s |
|---|---|---|---|---|
| GPT-o1-mini | 7.10 | 1,788 | 6.02 | 9.14 |
| DeepSeek | 55.89 | 1,641 | 24.81 | 95.95 |
| Claude | 7.99 | 1,017 | 5.01 | 11.52 |
| Gemini | 4.53 | 1,441 | 3.83 | 5.63 |
客观来讲,DeepSeek就算不用官方API,速度也非常慢,主要原因是R1会把思考过程输出,这在chat模式下体验尚可,但API调用就很头疼——其他模型等个饭的功夫,DeepSeek要等到睡觉。
Gemini-2.0目前还没火,但个人感觉Google的东西潜力最大,特别是速度和多模态处理上。输出结果不一定是最好的,但基本能按要求完成任务,错误也较少。