Paper: 2604.19598 Authors: Kihyuk Lee Categories: cs.AI, cs.CL
Abstract
This study compared repeated generation consistency of exercise prescription outputs across three large language models (LLMs): GPT-4.1, Claude Sonnet 4.6, and Gemini 2.5 Flash, under temperature=0 conditions. Each model generated prescriptions for six clinical scenarios 20 times, yielding 360 total outputs analyzed across four dimensions: semantic similarity, output reproducibility, FITT classification, and safety expression.
Key Findings
- GPT-4.1: 100% unique outputs with highest semantic similarity (0.955) - varying form but stable content
- Claude Sonnet 4.6: 70% unique outputs, semantic similarity 0.903
- Gemini 2.5 Flash: Only 27.5% unique outputs - produces high similarity through text duplication
Critical Insight
Temperature=0 does NOT guarantee determinism! The same setting produced fundamentally different consistency profiles:
- GPT-4.1 varies surface expression while maintaining semantic stability
- Gemini 2.5 Flash exhibits pronounced output repetition (2 unique outputs across 20 trials in one scenario)
Methodology
- 6 clinical scenarios: knee osteoarthritis, cancer patient, healthy adults
- 20 repeated generations per scenario per model
- Metrics: SBERT cosine similarity, FITT classification, safety expression
- All models showed ceiling-level safety (3.93-3.99/4.00)
Results
| Model | Semantic Similarity | Unique Outputs |
|---|---|---|
| GPT-4.1 | 0.955 | 100% |
| Gemini 2.5 Flash | 0.950 | 27.5% |
| Claude Sonnet 4.6 | 0.903 | 70.0% |
Takeaways
- Model selection for clinical deployment is a clinical decision, not just technical
- Single-output evaluations cannot capture fundamental consistency differences
- Gemini’s high similarity derives from repetition, not stable reasoning
- Safety expression has converged to baseline across current LLMs
论文: 2604.19598 作者: Kihyuk Lee 分类: cs.AI, cs.CL
摘要
本研究比较了GPT-4.1、Claude Sonnet 4.6和Gemini 2.5 Flash三种大语言模型在temperature=0条件下重复生成运动处方的一致性。每个模型为6个临床场景各生成20次处方,共360个输出,从四个维度进行分析:语义相似度、输出可重复性、FITT分类和安全性表达。
关键发现
- GPT-4.1:100%独特输出,语义相似度最高(0.955)——形式多样但内容稳定
- Claude Sonnet 4.6:70%独特输出,语义相似度0.903
- Gemini 2.5 Flash:仅27.5%独特输出——通过文本重复实现高相似度
核心洞察
Temperature=0不能保证确定性!相同设置产生了根本不同的一致性特征:
- GPT-4.1变化表面表达同时保持语义稳定性
- Gemini 2.5 Flash表现出明显的输出重复(在一个场景的20次试验中仅2个独特输出)
方法论
- 6个临床场景:膝关节骨关节炎、癌症患者、健康成人
- 每个场景每个模型重复生成20次
- 指标:SBERT余弦相似度、FITT分类、安全性表达
- 所有模型均达到天花板级安全性(3.93-3.99/4.00)
实验结果
| 模型 | 语义相似度 | 独特输出比例 |
|---|---|---|
| GPT-4.1 | 0.955 | 100% |
| Gemini 2.5 Flash | 0.950 | 27.5% |
| Claude Sonnet 4.6 | 0.903 | 70.0% |
要点总结
- 临床部署的模型选择是临床决策,而非仅是技术决策
- 单次输出评估无法捕捉根本的一致性差异
- Gemini的高相似度来自重复而非稳定的推理
- 安全性表达已在当前LLM中收敛到基线水平