AI Agent 期刊

历史存档 · 共 107 期

今日刊 →
107
归档期数
11
分页
10
每页期数
2026-09-28 周一

AgentKernel: The Trust-Native Agentic Operating System

Modern AI agents routinely cross trust boundaries: they ingest untrusted content, combine it with privileged instructions, persist intermediate beliefs in long-term memory, and invoke privileged tools. This creates an attack surface in which malicious payloads can enter through model inputs and cause harmful tool actions.

16
2026-09-24 周四

Agensh: Scaling Organizational Intelligence to 1,024 Agents

我们推出了Agensh ,这是一种可扩展的自组织多智能体线束,没有中央编排器,可扩展到1,024个智能体。并发工作者执行多Agent协作循环,收集上下文,自行分配子任务,采取行动,共享发现,验证结果,异步合并进度。

20
2026-09-23 周三

ACLArena: Agent Continue Learning in Multi-stage Post-training

为工业部署构建通用代理需要集成在不同培训阶段获得的多种功能,但代理持续学习没有完善的配方。我们介绍了ACLArena ,这是一个用于研究和评估代理持续学习的框架,并提出了一种新的配方,该配方将高质量轨迹的离线重播与LoRA专家的路由网络相结合。

19
2026-09-22 周二

BI-Agent and BI-Bench: Towards Automating End-to-End Business Intelligence

商业智能(BI)是企业决策的基石,在Power BI和Tableau等软件中被企业用户广泛使用。在传统的商业智能工作流程中,用户需要通过( 1 )识别相关表格, ( 2 )执行数据转换,以及( 3 )建立加入关系来准备数据,然后才能( 4 )回答他们的业务问题。

18
2026-09-21 周一

RetireOPD: Self-Retiring On-Policy Distillation for Agentic Reinforcement Learning

受过强化学习( RL )训练的多回合代理在每个轨迹上获得单个标量奖励,这激励自我策略提取( OPD ) ,由具有特权任务技能的自学老师提供密集的令牌级监督,让没有技能的学生将它们内化。因此,我们建议RetireOPD (自我退休随机蒸馏) ,它首先优化具有环境奖励的解耦,技能条件的教师,然后与R共同培训无技能的学生

18
2026-09-20 周日

Reflect, Revise, Reuse: Training-Free Skill Evolution for GUI Agents

GUI代理在动态图形用户界面上执行长时间任务,其中弹出窗口、延迟加载和重新定位的小部件通常会使执行前修复的计划无效。我们提出了EvoSkill-GUI ,这是一个无需培训的框架,其中每个技能都是一个结构化的多文件包,包含检索元数据、可执行计划、备份本地化、故障恢复规则、可访问性实用程序和故障情况。

19
2026-09-16 周三

Agentic Societies Need a Social Harness

【arXiv】代理社会是人工智能代理的集合,它们代表目标可能仅部分一致的不同委托人,跨越信任边界进行自主协调。我们通过实验表明,在代理社会中,甚至诚实,有能力

19
2026-09-13 周日

T1: Terminal Agent Reinforcement Learning for Long-Horizon Tasks

座席的使用正在转向编码和科学发现等长远任务,其中终端任务尤为重要。我们引入了T1 ,这是一种专家混合模型,总数为122B ,经过强化学习训练,在云沙箱中操作真实shell ,每个任务最多可调用300多个工具,通过执行每个任务自己的验证器获得奖励。

19
2026-09-09 周三

HarvestBench: Measuring Whether LLM Agents Will Pay to Avoid Killing Animals

智能体在实现目标的过程中造成的副作用的基准已经存在,但HarvestBench是第一个对避免副作用定价并将该副作用命名为生物的基准。这是一个农场模拟: LLM子代理与田间动物一起驾驶两辆拖拉机通过合作玉米收获。

18
2026-09-04 周五

HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness?

随着代理从研究原型转向部署工具,他们的能力越来越依赖于模型-外部执行基础设施,通常称为代理线束。在保持模型权重固定的同时更改此线束可以大大改变任务性能。

19