开源音频编辑器 Audionaut 引入 AI 代理

开源音频编辑器 Audionaut 引入 AI 代理功能。该特性基于 MCP 协议,支持可撤销编辑并确立“人类优先”原则,同时集成本地运行的干声分离技术,确保操作安全可控。

免费开源多轨音频编辑器 Audionaut 引入 AI 代理功能,支持可撤销编辑

Audionaut 是一款适用于 Windows、macOS 和 Linux 平台的免费开源多轨音频编辑器。该项目近期引入了人工智能辅助编辑功能,其核心设计理念在于确保 AI 代理对已打开项目的修改操作具备可逆性,即所有由代理生成的编辑均可通过编辑器标准的撤销系统进行还原。

AI编辑可撤销且人类优先

根据开发者于 10 月 2 日发布的 Show HN 帖子介绍,代理控制功能基于模型上下文协议(MCP)实现。Audionaut 的 MCP 服务器将编辑器的命令行操作封装为兼容代理可调用的工具集。这些工具涵盖音频导入与导出、剪辑分析、分割与移动、效果器参数调整、速度变换、编曲组装以及音轨分离等功能。

Audionaut 的 MCP 工作流将代理命令传递给一个开放的项目,在那里完成的编辑可以进入正常的撤销历史记录。

该应用在处理并发操作时确立了“人类优先”的原则。当 AI 代理正在处理一个包含未保存更改的已打开项目时,代理产生的编辑结果会被追加至正常的撤销历史中,但不会自动写入项目文件,用户需自行决定何时保存。若用户在代理指令执行期间进行了其他手动修改,文档规定代理的结果将被丢弃并提示重试,以避免覆盖新的人类编辑。此外,系统在录制过程中拒绝执行命令,在播放过程中拒绝执行导出操作。

针对 Hacker News 社区提出的改进建议,如简化文件导入流程、增加自动交叉淡入淡出、封面图管理及更多效果器等,开发者回应称这些需求已被纳入项目积压清单。目前尚不清楚这些评论是否代表了 Audionaut 整体性能或采用率的广泛反馈。

在应用程序的时间表中显示了多个音频区域。

Audionaut 还集成了基于 Meta AI Research 开发的 htdemucs 模型的干声分离功能,通过 demucs.cpp 引擎运行。该功能可将选定的单声道或立体声剪辑拆分为鼓、低音、其他人声和伴奏四个独立轨道。根据官方文档,分离模型需一次性下载约 80MB 数据,随后在本地计算机上进行处理。目前的实现版本支持长达 10 分钟的片段,且完全依赖 CPU 进行运算。值得注意的是,由于所有生成轨道均处于同一撤销栈中,一次撤销操作即可移除这四个新生成的轨道。

开发者指出,尽管 Audionaut 提供了自动化处理能力,但 AI 生成的编辑结果及干声分离效果仍需经过人工微调才能达到最佳状态。该实现的独特价值在于将代理操作无缝整合进现有的项目管理和撤销系统中,而非将其视为不可逆转的外部变更。

Audionaut 作为免费开源软件,其官方网站提供 Windows、macOS 和 Linux 版本的构建包,源代码托管于 GitHub 仓库。相关技术细节可参考其 CLI 与 AI 代理手册及干声分离文档。

评论 0

0/500

评论需审核后展示,请文明发言

💬
还没有评论,来说两句

相关阅读