Hugging Face Daily Papers · · 4 min read

The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation

Mirrored from Hugging Face Daily Papers for archival readability. Support the source by reading on the original site.

\n<li><strong>Homepage:</strong> <a href=\"https://quester-one.github.io/PlanPhysWebsite/\" rel=\"nofollow\">https://quester-one.github.io/PlanPhysWebsite/</a></li>\n<li><strong>GitHub:</strong> <a href=\"https://github.com/Quester-one/PlanPhysCode\" rel=\"nofollow\">https://github.com/Quester-one/PlanPhysCode</a></li>\n<li><strong>Hugging Face Model:</strong> <a href=\"https://huggingface.co/MultimodalAgent/TianyiMen_PlanPhys_Models\">https://huggingface.co/MultimodalAgent/TianyiMen_PlanPhys_Models</a></li>\n<li><strong>Hugging Face Dataset:</strong> <a href=\"https://huggingface.co/datasets/MultimodalAgent/TianyiMen_PlanPhys_Datasets\">https://huggingface.co/datasets/MultimodalAgent/TianyiMen_PlanPhys_Datasets</a></li>\n</ul>\n","updatedAt":"2026-07-28T04:34:31.682Z","author":{"_id":"643379416c6ecd58798421b3","avatarUrl":"/avatars/831db7eab2663abc33b176cf386b02f2.svg","fullname":"Zhuoran Jin","name":"jinzhuoran","type":"user","isPro":false,"isHf":false,"isHfAdmin":false,"isMod":false,"followerCount":11,"isUserFollowing":false}},"numEdits":0,"identifiedLanguage":{"language":"en","probability":0.49750131368637085},"editors":["jinzhuoran"],"editorAvatarUrls":["/avatars/831db7eab2663abc33b176cf386b02f2.svg"],"reactions":[],"isReport":false}}],"primaryEmailConfirmed":false,"paper":{"id":"2607.24720","authors":[{"_id":"6a68309973f69d5af2bec8b0","name":"Tianyi Men","hidden":false},{"_id":"6a68309973f69d5af2bec8b1","name":"Zhuoran Jin","hidden":false},{"_id":"6a68309973f69d5af2bec8b2","name":"Kang Liu","hidden":false},{"_id":"6a68309973f69d5af2bec8b3","name":"Jun Zhao","hidden":false}],"publishedAt":"2026-07-27T00:00:00.000Z","submittedOnDailyAt":"2026-07-28T00:00:00.000Z","title":"The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation","submittedOnDailyBy":{"_id":"643379416c6ecd58798421b3","avatarUrl":"/avatars/831db7eab2663abc33b176cf386b02f2.svg","isPro":false,"fullname":"Zhuoran Jin","user":"jinzhuoran","type":"user","name":"jinzhuoran"},"summary":"Multi-turn long-horizon planning is critical for foundation model agents, yet how to fundamentally improve it remains unclear. Existing models are trained on uncontrollable and opaque Internet data, making it difficult to identify how planning ability is acquired, shaped, and integrated. To address this challenge, we introduce a unified and controlled multi-turn environment that enables precise control. It allows systematically study long-horizon planning across three stages. (1) Planning ability acquisition during pre-training. We study data format, distribution, and quality. Explicit world model construction through CoT state transition modeling yields stronger long-horizon generalization. Atomic skills alone are insufficient for compositional generalization, whereas a litte long-horizon data works. Moreover, suboptimal trajectories severely impair performance because errors amplify over long horizons. (2) Planning ability shaping via GRPO and OPD post-training. Through mutual information, we distinguish general planning patterns from task-specific planning knowledge. For planning patterns, we identify three application regions of post-training: unnecessary, effective, and unsupported. OPD has a broader effective region than GRPO under low-quality and long-horizon settings, as it provides more consistent update directions. For planning knowledge, distilling unseen procedures from a teacher with different knowledge may impair student's prior world modeling without fully establishing new knowledge. (3) Planning ability integration through MOPD post-training. We show that multi-teacher on-policy distillation (MOPD) integrates capabilities by converging to shared planning-pattern across environments. Compatible patterns enable cross-environment generalization, partially shared patterns support continual learning, while completely conflicting patterns cause severe interference.","upvotes":19,"discussionId":"6a68309973f69d5af2bec8b4","projectPage":"https://quester-one.github.io/PlanPhysWebsite/","githubRepo":"https://github.com/Quester-one/PlanPhysCode","githubRepoAddedBy":"user","githubStars":5,"organization":{"_id":"640a887796aae649741a586f","name":"CASIA","fullname":"Chinese Academic of Science Institute of Automation","avatar":"https://cdn-avatars.huggingface.co/v1/production/uploads/1678411888885-6388984e8a5dbe2f3dc5afee.jpeg"}},"canReadDatabase":false,"canManagePapers":false,"canSubmit":false,"hasHfLevelAccess":false,"upvoted":false,"upvoters":[{"_id":"643379416c6ecd58798421b3","avatarUrl":"/avatars/831db7eab2663abc33b176cf386b02f2.svg","isPro":false,"fullname":"Zhuoran Jin","user":"jinzhuoran","type":"user"},{"_id":"66d94b49eae491c642e8fa5d","avatarUrl":"/avatars/d8f57605b2dd21cf0e39fb1b4014a742.svg","isPro":false,"fullname":"charliezhang","user":"Clockz","type":"user"},{"_id":"67c6744ffaf82ef97dbe871d","avatarUrl":"/avatars/fe9f2c8bb3c98af3177a1170a6829913.svg","isPro":false,"fullname":"Longxiang Wang","user":"wlxxx","type":"user"},{"_id":"6555ca4b5891609e4558dd2a","avatarUrl":"/avatars/30395217fc2e6dbed8e261e1fa4883a6.svg","isPro":false,"fullname":"Tianyi Men","user":"MultimodalAgent","type":"user"},{"_id":"67d15f29bacfd19231a6e178","avatarUrl":"https://cdn-avatars.huggingface.co/v1/production/uploads/no-auth/I0CxXy7s-Huy495htZlJC.png","isPro":false,"fullname":"Lu Wang","user":"wanglu666","type":"user"},{"_id":"670e62744a96858b07e44d4f","avatarUrl":"/avatars/c8967292ab9ee80535bc8a4a53345f2d.svg","isPro":false,"fullname":"Suifeng Zhao","user":"zhaosuifeng","type":"user"},{"_id":"65155fb74545b488595c7658","avatarUrl":"/avatars/0bca6d5f763ef169487b21c3df750077.svg","isPro":false,"fullname":"Che Liu","user":"atporter","type":"user"},{"_id":"67bd947a87f52c5c90862959","avatarUrl":"/avatars/1e362fd9197802901e18205cbc4ace4b.svg","isPro":false,"fullname":"Hua","user":"Sophia0777","type":"user"},{"_id":"616648c84c0937d31946f21b","avatarUrl":"/avatars/7ca27de5c5116c91ff1db61ba6277ed5.svg","isPro":false,"fullname":"Ziyang","user":"hzy","type":"user"},{"_id":"63ac5701c21e60a3e9b58aa7","avatarUrl":"https://cdn-avatars.huggingface.co/v1/production/uploads/63ac5701c21e60a3e9b58aa7/g6EX7diOpuA94R2ab-rZC.png","isPro":true,"fullname":"Dipankar Sarkar","user":"dipankarsarkar","type":"user"},{"_id":"64fed9eb56243ce8cb66beec","avatarUrl":"https://cdn-avatars.huggingface.co/v1/production/uploads/no-auth/_KVMINyIbVQFzreQBogct.png","isPro":false,"fullname":"BY.W","user":"chuanshuogushi","type":"user"},{"_id":"6645c2bb87866bc4c9c11fab","avatarUrl":"/avatars/e900c655fa6b057d7b85b7961d5fb227.svg","isPro":false,"fullname":"JiaKuan Xie","user":"jkxie","type":"user"}],"acceptLanguages":["en"],"dailyPaperRank":0,"organization":{"_id":"640a887796aae649741a586f","name":"CASIA","fullname":"Chinese Academic of Science Institute of Automation","avatar":"https://cdn-avatars.huggingface.co/v1/production/uploads/1678411888885-6388984e8a5dbe2f3dc5afee.jpeg"},"markdownContentUrl":"https://huggingface.co/buckets/huggingchat/papers-content/resolve/2607/2607.24720.md","query":{}}">
Papers
arxiv:2607.24720

The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation

Published on Jul 27
· Submitted by
Zhuoran Jin
on Jul 28
Authors:
,

Abstract

Multi-turn long-horizon planning is critical for foundation model agents, yet how to fundamentally improve it remains unclear. Existing models are trained on uncontrollable and opaque Internet data, making it difficult to identify how planning ability is acquired, shaped, and integrated. To address this challenge, we introduce a unified and controlled multi-turn environment that enables precise control. It allows systematically study long-horizon planning across three stages. (1) Planning ability acquisition during pre-training. We study data format, distribution, and quality. Explicit world model construction through CoT state transition modeling yields stronger long-horizon generalization. Atomic skills alone are insufficient for compositional generalization, whereas a litte long-horizon data works. Moreover, suboptimal trajectories severely impair performance because errors amplify over long horizons. (2) Planning ability shaping via GRPO and OPD post-training. Through mutual information, we distinguish general planning patterns from task-specific planning knowledge. For planning patterns, we identify three application regions of post-training: unnecessary, effective, and unsupported. OPD has a broader effective region than GRPO under low-quality and long-horizon settings, as it provides more consistent update directions. For planning knowledge, distilling unseen procedures from a teacher with different knowledge may impair student's prior world modeling without fully establishing new knowledge. (3) Planning ability integration through MOPD post-training. We show that multi-teacher on-policy distillation (MOPD) integrates capabilities by converging to shared planning-pattern across environments. Compatible patterns enable cross-environment generalization, partially shared patterns support continual learning, while completely conflicting patterns cause severe interference.

Community

Upload images, audio, and videos by dragging in the text input, pasting, or clicking here.
Tap or paste here to upload images

· Sign up or log in to comment

Get this paper in your agent:

hf papers read 2607.24720
Don't have the latest CLI?
curl -LsSf https://hf.co/cli/install.sh | bash

Models citing this paper

No model linking this paper

Cite arxiv.org/abs/2607.24720 in a model README.md to link it from this page.

Datasets citing this paper

No dataset linking this paper

Cite arxiv.org/abs/2607.24720 in a dataset README.md to link it from this page.

Spaces citing this paper

No Space linking this paper

Cite arxiv.org/abs/2607.24720 in a Space README.md to link it from this page.

Collections including this paper

Discussion (0)

Sign in to join the discussion. Free account, 30 seconds — email code or GitHub.

Sign in →

No comments yet. Sign in and be the first to say something.

More from Hugging Face Daily Papers