Press ESC to close Press ⌘K or Ctrl+K to open

Recent Posts

Decoupling Exploration from Optimization in RLVR

解耦 RLVR 中的探索与优化:ExpDis 框架如何激发大模型推理多样性

EngramEdit: Decoupled Knowledge Updates in LLMs through Conditional Memory

EngramEdit:利用条件记忆解耦大语言模型的事实知识编辑

Agent in a Bottle: Can LLM Agents Turn Their Capabilities Into Cheap, Scalable Artifacts?

装瓶智能体:大模型能否将自身能力编译为廉价高效的复用制品?

World Models' Last Exam in Physics

世界模型的物理学终考:基于物理测量的严苛基准检验

Base Models Can Reason By Taking a Cue From Training Data

基座大模型本就会推理:前缀提示词如何激活预训练的思维潜能

CLIFT: Conformal Self-Verification for Web Agent Training and Test-Time Scaling

CLIFT:基于共形自验证的网页智能体训练与测试期扩展

LESSER: Post-Training Data Selection with Output-Layer Gradients

LESSER:用输出层梯度实现低成本大模型后训练数据选择

What Should World Models Forget? Stratified Retention for Continual Adaptation

世界模型应该遗忘什么?持续适应中的分层保留范式

On the Off-Policy Teacher in On-Policy Distillation

同策略蒸馏中的离策略教师困局

Semifactual Credit-Augmented Policy Optimization

半事实信用增强策略优化:瓦解 GRPO 的虚假关联

Imagine3D-LLM: Teaching MLLMs to Imagine 3D Scenes Before Answering

Imagine3D-LLM:让多模态大模型在作答前先构想 3D 场景

Telescopic Language Models

望远镜语言模型:单次训练贯通全深度算力连续谱

View all posts →

Series