关于外甥女是否适合3+4中本贯通培养的升级版综合评估报告(数据增强版)
基于河南省2026年3+4政策,结合驻马店高级中学历年数据,综合分析成绩靠前的初三学生是否应选择中本贯通路径
持续追踪 OpenAI、Anthropic、Google DeepMind、NVIDIA 等研究机构,将论文和技术博客整理为高质量阅读笔记。
基于河南省2026年3+4政策,结合驻马店高级中学历年数据,综合分析成绩靠前的初三学生是否应选择中本贯通路径
从四篇权威综述出发,系统梳理 LLM 对齐技术的演进路线、主流方法对比与前沿方向
# 【阅读笔记】Self-play SWE-RL (SSR):让 Agent 自己出题、自己做题 > 论文链接:https://arxiv.org/abs/2512.18552 > 作者:Meta FAIR,2025年12月 --- ## 1. 一句话总结 Agent 自己向代码库注入 Bug、自己尝试修复,通过双角色自博弈完全摆脱人工标注数据,在 SWE-bench Verified 上...
# 【阅读笔记】Agent-RLVR:用 Guidance 破解 Agent RL 的稀疏奖励难题 > 论文链接:https://arxiv.org/abs/2506.11425 > 作者:Scale AI,2025年6月 --- ## 1. 一句话总结 在多步骤 Agent 任务中,用外部 LLM 提供"导师级提示"帮助失败的 rollout 走出困境,让 RL 训练从稀疏奖励中有效学习...
# 【阅读笔记】SWE-RL:用开源软件演化数据训练代码推理 > 论文链接:https://arxiv.org/abs/2502.18449 > 作者:Meta/FAIR,2025年2月 --- ## 1. 一句话总结 首个将基于规则的强化学习直接应用于真实 GitHub PR 数据的软件工程训练方法,让70B模型在 SWE-bench Verified 达到41.0%,并意外涌现出跨域推...
这篇论文本质上是在解决如何让 LLM 在真实互联网交互中通过端到端强化学习,学会鲁棒的深度研究能力的问题。
这篇文章本质上是在解决如何用端到端强化学习训练一个能在真实互联网上完成多步骤深度研究的 Agent 的问题。
# 【阅读笔记】Toolformer:让语言模型自主学会调用外部工具 > 论文:Toolformer: Language Models Can Teach Themselves to Use Tools > 作者:Meta AI Research(Timo Schick 等) > 发表:NeurIPS 2023 > arXiv:https://arxiv.org/abs/2302.04761 ...
# 【阅读笔记】WebArena:构建真实网页 Agent 评测环境 > 论文:WebArena: A Realistic Web Environment for Building Autonomous Agents > 作者:CMU(Shuyan Zhou 等) > 发表:ICLR 2024 > arXiv:https://arxiv.org/abs/2307.13854 --- ## 1...
# 【阅读笔记】Agent Skills:让 Agent 按需加载专域能力的工程架构 > 原文:https://www.anthropic.com/engineering/equipping-agents-for-the-real-world-with-agent-skills > 发布:2025年10月16日 > 来源:Anthropic Engineering Blog --- ## 1...
# 【阅读笔记】Effective Context Engineering:从 Prompt 工程到上下文工程 > 原文:https://www.anthropic.com/engineering/effective-context-engineering-for-ai-agents > 发布:2025年9月29日 > 来源:Anthropic Engineering Blog --- ##...
# 【阅读笔记】Claude Code Best Practices:Agentic 编程的工程实践指南 > 原文:https://www.anthropic.com/engineering/claude-code-best-practices > 来源:Anthropic Engineering Blog --- ## 1. 一句话总结 Context Window 是 Agentic ...