RLE 设计三论文:SWE-Bench / GAIA / BrowserArena
SWE-Bench以真实GitHub Issue构建最成熟RL训练环境(解决率从2%升至72%);GAIA揭示AI通用可靠性缺口;BrowserArena探索开放Web评估与步骤级反馈。
持续追踪 OpenAI、Anthropic、Google DeepMind、NVIDIA 等研究机构,将论文和技术博客整理为高质量阅读笔记。
SWE-Bench以真实GitHub Issue构建最成熟RL训练环境(解决率从2%升至72%);GAIA揭示AI通用可靠性缺口;BrowserArena探索开放Web评估与步骤级反馈。
OpenHands以事件流+Docker沙箱+CodeAct行动空间构建标准化Agent Runtime,天然对接RL训练,SWE-Bench 72%;OpenManus为通用Agent场景开源复现。
CAMEL用Inception Prompting实现自主角色扮演;AgentVerse引入动态专家招募+四阶段MDP;MetaGPT以SOP+结构化文档消灭级联幻觉,HumanEval 85.9%。
冻结主干LLM只训练轻量级残差侧网络,主干不变则缓存表示永不过时,支持65k Token级别长期记忆。
借鉴卡片盒笔记法,让Agent记忆自动建立语义关联网络并动态演化。Multi-Hop F1比MemGPT提升79%,Token消耗仅其1/6。
借鉴OS虚拟内存思想,让LLM自己管理分层记忆(RAM/磁盘),通过函数调用主动存取,解决上下文窗口限制。多跳检索准确率从32%提升到92.5%。
整理8篇核心论文/帖子对RLE架构设计和算法改进的可落地思路,覆盖环境设计、奖励建模、上下文工程等维度。
# Agentic Mfw - infra 架构解读 **作者:dodo** > **原文**:https://agenticmotherfucking.website/ > **发布时间**:2026-06-03(约) > **解读视角**:大模型基础建设架构设计 > **沉淀时间**:2026-06-04 --- ## 一句话核心 这是一篇辛辣的技术讽刺文,以「vibe-coded ...
URIAL 通过3个高质量 ICL 示例,无需任何参数训练,直接将 Base Model 对齐为 Chat 风格,颠覆了对齐必须依赖训练的传统假设。
# MAI-Code-1-Flash - infra 架构解读 **作者:dodo** > **原文**:https://microsoft.ai/news/introducingmai-code-1-flash/ > **发布时间**:2026-06-02 > **解读视角**:大模型基础建设架构设计 > **沉淀时间**:2026-06-04 --- ## 一句话核心 MAI-Cod...
# Use your Nvidia GPU's VRAM as swap space on Linux - infra 架构解读 **作者:dodo** > **原文**:https://github.com/c0dejedi/nbd-vram > **发布时间**:2026-06-01 > **解读视角**:大模型基础建设架构设计 > **沉淀时间**:2026-06-04 --- ##...
2026年河南省首次推行"3+4"中职本科贯通培养政策,本报告补充国家政策背景、先行省市10年参照数据、驻高近五年升学趋势、转段考核通过率风险量化、985/211概率差距对比矩阵等多维数据,系统性论证成绩优异学生不适合选择"3+4"路径,推荐驻高普通班→全国高考升学路径。