AI技术研报-这里有最前沿的人工智能技术解读

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
开源Editable-Design,让AI生图终于能改字、拖图层

开源Editable-Design,让AI生图终于能改字、拖图层

开源Editable-Design,让AI生图终于能改字、拖图层

开源项目 Editable Design 结合视觉模型、HTML 代码与持续工作的 Agent,将 AI 生图重构为可编辑的设计文件,使文字可直接修改、图层可独立拖动,仓库展示了 14 组覆盖营销海报、信息设计等 6 类视觉任务的案例。

来自主题: AI技术研报
7832 点击    2026-09-19 14:55
你每月花钱养的办公Agent,最后成了谁的资产?

你每月花钱养的办公Agent,最后成了谁的资产?

你每月花钱养的办公Agent,最后成了谁的资产?

文章指出当办公Agent深度介入工作后,用户面临工作方式主导权被平台锁定的风险,认为模型开源不等于Agent开源,Agent Runtime开源才是关键,并以DeepSeek发布的Harness和网易有道开源的LobsterAI(含OpenClaw)为例,说明开源Agent Runtime能为用户带来数据主权、可审计性、连续性和可定制性。

来自主题: AI技术研报
8817 点击    2026-09-19 10:58
梯度分享 | a16z最新报告:模型成为基础能力,AI应用进入价值扩散阶段

梯度分享 | a16z最新报告:模型成为基础能力,AI应用进入价值扩散阶段

梯度分享 | a16z最新报告:模型成为基础能力,AI应用进入价值扩散阶段

AI 正在从一项核心技术,逐渐变成商业软件背后的基础设施。当模型能力持续提升、AI 智能越来越标准化之后,企业真正需要竞争的空间也开始向应用层移动。 a16z 最新发布的一篇报告中,讨论的正是这一变化

来自主题: AI技术研报
6998 点击    2026-09-19 10:57
大模型Scaling撞上成本墙:三星提出TrOPD新方法,把前沿智能塞进数亿终端

大模型Scaling撞上成本墙:三星提出TrOPD新方法,把前沿智能塞进数亿终端

大模型Scaling撞上成本墙:三星提出TrOPD新方法,把前沿智能塞进数亿终端

三星大模型团队联合牛津大学、北京大学提出TrOPD方法,通过信任域机制让端侧模型更稳定高效地继承大模型推理能力,在数学、代码、指令遵循、STEM基准上全面超越现有OPD方法,为前沿智能以更低成本走向数亿终端提供新路径。

来自主题: AI技术研报
7994 点击    2026-09-18 15:48
EMNLP 2026主会|北大×易鑫AI Lab:大模型明明「知道」,为什么还会答错?

EMNLP 2026主会|北大×易鑫AI Lab:大模型明明「知道」,为什么还会答错?

EMNLP 2026主会|北大×易鑫AI Lab:大模型明明「知道」,为什么还会答错?

北京大学与易鑫AI Lab合作论文被EMNLP 2026主会接收,提出大模型"读出瓶颈"(Readout Bottleneck)概念,指出模型隐藏状态已编码正确答案却被输出层偏置掩盖,仅用2个无标签参数修正即可在多项推理任务上将准确率从33.3%盲猜水平大幅恢复。

来自主题: AI技术研报
7832 点击    2026-09-18 15:48
流式推理优化,让机器人决策延迟低至0.68秒

流式推理优化,让机器人决策延迟低至0.68秒

流式推理优化,让机器人决策延迟低至0.68秒

SimpleMemVLA由面壁智能联合华中科技大学等机构提出,将带时间戳的原生视觉历史直接作为机器人记忆上下文,在四项记忆基准取得SOTA并涌现视觉上下文学习能力,同时通过流式推理优化将60秒历史决策延迟从1.02秒降至0.68秒。

来自主题: AI技术研报
9245 点击    2026-09-18 15:47
CoRL 2026重磅开源!Sharpa世界联觉模型实现真实扰动鲁棒手内操作

CoRL 2026重磅开源!Sharpa世界联觉模型实现真实扰动鲁棒手内操作

CoRL 2026重磅开源!Sharpa世界联觉模型实现真实扰动鲁棒手内操作

灵巧手从 demo 走向真实应用,关键不只是 “会不会动”,而是能否在 noisy depth、稀疏触觉、外力扰动和未见物体下稳定泛化。现有 in-hand manipulation 往往依赖固定物体、定初始位姿或理想传感器。而一旦遇到真实深度噪声、形状变化和接触状态不可见,这些策略就容易退化成近乎开环的 “手指套路”。

来自主题: AI技术研报
10220 点击    2026-09-18 09:59
TPAMI26 | 全面升级PolaFormer++:极性感知计算流 +通道级尖峰,实现线性注意力的新天花板

TPAMI26 | 全面升级PolaFormer++:极性感知计算流 +通道级尖峰,实现线性注意力的新天花板

TPAMI26 | 全面升级PolaFormer++:极性感知计算流 +通道级尖峰,实现线性注意力的新天花板

继 ICLR 2025 的 PolaFormer 之后,哈工大(深圳)与鹏城实验室合作的扩展版本 PolaFormer++ 近日被 IEEE TPAMI 正式接收。新版本在理论框架、特征映射设计和实验覆盖面上全面升级:首次给出判定特征映射是否具备「降熵尖锐性」的理论判据,并提出极性感知的通道级尖锐(PaCS)特征映射,在六大类视觉核心任务上全面验证了线性注意力的潜力。

来自主题: AI技术研报
8377 点击    2026-09-18 09:35
Anthropic做药,Isomorphic补大模型,Anew带着什么走到台前?

Anthropic做药,Isomorphic补大模型,Anew带着什么走到台前?

Anthropic做药,Isomorphic补大模型,Anew带着什么走到台前?

一笔融资、一份技术报告,让一个过去五年鲜少公开发声的团队,逐渐显露出更完整的面貌。

来自主题: AI技术研报
9900 点击    2026-09-17 15:22
OpenAI把AI推向物理世界,这家公司已造好引擎,下一站1000万小时人类经验

OpenAI把AI推向物理世界,这家公司已造好引擎,下一站1000万小时人类经验

OpenAI把AI推向物理世界,这家公司已造好引擎,下一站1000万小时人类经验

9 月 3 日,OpenAI 正式发布 GPT-6 Astra。在 ARC-AGI-3(一个考验 AI 能否在陌生环境中自主探索、理解规则并规划行动的 Benchmark),Astra 拿下 99.9%,并在 96% 的关卡中达到或超过人类的行动效率基准。

来自主题: AI技术研报
9241 点击    2026-09-17 15:22
AI Agent安全不能只靠Prompt了:上海AI Lab探索Agent安全进化新范式

AI Agent安全不能只靠Prompt了:上海AI Lab探索Agent安全进化新范式

AI Agent安全不能只靠Prompt了:上海AI Lab探索Agent安全进化新范式

大模型 Agent 进入浏览器、邮件、数据库和业务系统后,安全评估如果仍只检查最终回复是否包含有害内容,覆盖面会明显不足。Agent 需要规划步骤、读取外部信息并调用工具,风险可能出现在执行过程中的任一环节。

来自主题: AI技术研报
6929 点击    2026-09-17 14:55
Meshy: 角色驱动下SPMD范式的RL训练框架

Meshy: 角色驱动下SPMD范式的RL训练框架

Meshy: 角色驱动下SPMD范式的RL训练框架

在过去的几年里,LLM RL 系统的工作负载发生了巨大的变化。早期的 RLHF 围绕同步训练展开:模型按固定顺序进行生成、打分和训练,每个阶段之间有着明确的同步边界。如今,系统还需要处理异步生成、持续训练、多轮 Agent 以及与外部环境的交互 —— 那些在同步执行中原本隐含的状态、版本和故障边界,现在都必须显式地进行管理。

来自主题: AI技术研报
10047 点击    2026-09-17 10:11
从炒虾到通用“大脑”,Mobile ALOHA作者带来新模型

从炒虾到通用“大脑”,Mobile ALOHA作者带来新模型

从炒虾到通用“大脑”,Mobile ALOHA作者带来新模型

近期,由斯坦福大学计算机科学博士符梓鹏(Zipeng Fu)联合创立的新团队Reward AI,正式发布通用机器人策略OM-1(Omnibody Model 1),并公布了完整的Omnibody技术栈。

来自主题: AI技术研报
6584 点击    2026-09-16 15:34
Minimax H3 之后,又来了一位狠角色:智象 HD-V1 发布,视频模型开始理解现实世界!

Minimax H3 之后,又来了一位狠角色:智象 HD-V1 发布,视频模型开始理解现实世界!

Minimax H3 之后,又来了一位狠角色:智象 HD-V1 发布,视频模型开始理解现实世界!

最近几个月,AI 视频赛道开始热起来了: Seedance2.0 发布后,AI 视频进入可用阶段,MiniMax H3 发布后,以 1/4 的价格,把 Seedance 2.0 的成本打了下去,AI 视频成本进入平价时代。

来自主题: AI技术研报
9250 点击    2026-09-16 15:10
逆天,Pixmax 把AI视频里的打斗动作终于攻克了

逆天,Pixmax 把AI视频里的打斗动作终于攻克了

逆天,Pixmax 把AI视频里的打斗动作终于攻克了

Seedance 2.5 让我这个半吊子的AI视频创作者都能上瘾玩上一个多月,就不用再多余说表现有多强了吧。

来自主题: AI技术研报
7471 点击    2026-09-16 14:42
换题还是第一!DM0.5横扫RoboColiseum四榜

换题还是第一!DM0.5横扫RoboColiseum四榜

换题还是第一!DM0.5横扫RoboColiseum四榜

具身智能最近又多了一张榜单,而排在第一的,还是一个熟悉的名字:原力灵机 DM0.5。

来自主题: AI技术研报
9420 点击    2026-09-16 14:41
自进化社媒Agent!浙大x北大:从多模态任务编排到反馈驱动

自进化社媒Agent!浙大x北大:从多模态任务编排到反馈驱动

自进化社媒Agent!浙大x北大:从多模态任务编排到反馈驱动

当大模型已经能够快速生成文案、图片和视频,一个更进一步的问题是:Agent 能否从执行过的任务中积累经验,并在持续交互中改进后续行为?

来自主题: AI技术研报
9558 点击    2026-09-16 14:40
复杂的Harness Evolution,甚至不如多跑几遍

复杂的Harness Evolution,甚至不如多跑几遍

复杂的Harness Evolution,甚至不如多跑几遍

一个 Agent 第一次没把任务做对。

来自主题: AI技术研报
6446 点击    2026-09-16 14:40
复旦发布以人为中心的复杂场景音视频追踪基准 | ICML 2026

复旦发布以人为中心的复杂场景音视频追踪基准 | ICML 2026

复旦发布以人为中心的复杂场景音视频追踪基准 | ICML 2026

想象一下这个场景:一场多人线上会议,有人说话时画面自动聚焦到发言者;一段综艺素材,后期系统能自动识别谁在讲话并生成字幕;一段监控录像,系统能在人群中持续追踪正在说话的那个人。

来自主题: AI技术研报
7605 点击    2026-09-16 10:36