Tian2
← 手记 · AI工具
AI工具 · 物理碗

各个大语言模型整理物理碗题集精简版比较

2025-02-12·AI工具

关于几个大模型在推理以及物理方向应用的全主观、不客观测评。

之前整理的757页物理碗分类题集有点太长了,想着还是缩短一些比较好,同时也可以做成Anki卡片的形式,方便刷题,于是开始精简计划。

基本思路是把已有内容挨着一道一道题放进大模型,让其根据输入的题目和解答,重新输出精简版答案。使用的大模型都从OpenRouter上调API来跑。参赛选手如下(费用和延迟会有波动):

模型输入价格 $/M Token输出价格 $/M Token延迟 s
o1-mini1.14.40.72
DeepSeek-R10.82.40.73
Claude Sonnet3151.38
Gemini Flash 2.00.10.40.59

DeepSeek-R1官方费用是0.14 in / 0.55 out,但太火了,官方API延迟达到19.71s,于是用了加速版本。

精简结果:页数

精简前757页,精简后如下。整体来看差不多,各模型基本都能达到精简要求。

模型精简后页数缩减页数
o1-mini488269
DeepSeek-R1507250
Claude Sonnet459298
Gemini Flash 2.0477280

精简内容对比

挑一道相对论比较难的题目举例,以下是原题和详细解答:

物理碗原题示例 物理碗原题详细解答

o1-mini:

o1-mini精简输出

DeepSeek-R1:

DeepSeek-R1精简输出

Claude Sonnet:

Claude Sonnet精简输出

Gemini Flash 2.0:

Gemini Flash 2.0精简输出

整体来看,各模型都能基本完成任务,但各有侧重——GPT-o1-mini最简练,Gemini给出了完整计算过程,DeepSeek信息比较全面,Claude可能最符合我的解题习惯。

LaTeX编码问题

比较出乎意料的是,尽管Claude Sonnet在其他编程任务中基本是OpenRouter排名第一的模型,但在LaTeX编码中会出各种神奇的错误,以至于输出后我不得不另外写程序让ChatGPT给Claude修改LaTeX编译错误。GPT-o1-mini和Gemini在LaTeX方面表现不错,几百道题每个模型大概只有5个左右的小错误需要手动修正。

DeepSeek的问题在于:即使要求不输出思考过程,它还是会在很多题目中把思考过程写出来,而且思考过程不是LaTeX格式,所以需要花大量时间修正。这个问题会集中出现在某一章的题目中。此外,循环前半段DeepSeek并没有按要求完成任务,而是直接把输入内容原封不动地输出——到中间某个节点才突然开始按要求精简,导致第一版高达636页,后来又重跑了一遍才得到结果。

Gemini有些题目的输出极其内敛,只给公式不给文字说明,不知道是不是训练了太多学生作业。

各模型LaTeX输出示例对比

综合性能数据(10题测试)

模型平均耗时 s平均输出长度最短 s最长 s
GPT-o1-mini7.101,7886.029.14
DeepSeek55.891,64124.8195.95
Claude7.991,0175.0111.52
Gemini4.531,4413.835.63

客观来讲,DeepSeek就算不用官方API,速度也非常慢,主要原因是R1会把思考过程输出,这在chat模式下体验尚可,但API调用就很头疼——其他模型等个饭的功夫,DeepSeek要等到睡觉。

Gemini-2.0目前还没火,但个人感觉Google的东西潜力最大,特别是速度和多模态处理上。输出结果不一定是最好的,但基本能按要求完成任务,错误也较少。

Original note, February 2025. All model pricing and latency figures are approximate and subject to change. Tested via OpenRouter API.