跳转到主要内容

Kimi Work 能同时跑 300 个智能体,但我得看到操作记录

Kimi Work 可协调多达 300 个智能体处理本地文件、浏览器自动化和定时任务。在我让它整夜运行前,我需要一份清晰可查的操作记录。

Kimi5 分钟阅读
分享:
AI 驱动

AI 驱动 · 每小时限 20 次请求

Mark 正在研究一个卡通桌面智能体,它正在协调助手处理本地文件、浏览器任务、电子表格和日程安排
Kimi Work 将 AI 从聊天框带到了桌面上。一旦它能在不同应用间行动,每个操作都必须清晰可见。

Kimi Work 在 2026 年 6 月 3 日上线测试版,定位很宽。按 Kimi 的说法,这款桌面应用能挂载本地文件夹、通过 WebBridge 操控浏览器、跑 Python 或 Shell 脚本、排定时任务,还能同时协调最多 300 个子智能体。支持搭载 Apple Silicon 且系统版本不低于 macOS 12 的 Mac,以及 Windows 10 及以上的 PC。

我理解它的吸引力。一个实用的桌面智能体应该能帮你翻出季度 PDF、清理电子表格、补齐缺失的背景信息,最后把做好的演示文稿放进正确的文件夹。可一旦它能保持电脑唤醒、整夜自己干活,产品要考虑的就不只是模型聪不聪明了——我得确切知道它碰过哪些东西。

快速答案

Kimi Work 承诺的功能我在依赖它之前会检查的内容
本地文件访问文件夹范围、版本历史,以及每次写入的可恢复记录
定时 Python 和 Shell 任务运行历史、环境隔离、失败告警,以及可靠的停止控制
浏览器自动化凭据边界,以及访问页面和执行操作的完整追踪
最多 300 个子智能体每个子任务的所有权、冲突处理,以及明确的未完成工作标记

Kimi 推出的不是另一个聊天窗口,而是一个数字员工

产品页面把 Kimi Work 叫做“系统级数字员工”。这话有营销味,但方向没说错。Kimi 网页版等着用户输入提示才动;Kimi Work 不一样,它能把一句提示串到本地文件、浏览器、代码执行、定时任务和最终生成的办公文档上。

Kimi 的帮助中心把野心说得更具体:Work 模式能创建和整理文件夹、调用工具、加载上传的技能和可选插件,还能在单智能体和智能体群(Agent Swarm)之间切换。Kimi 还宣传它能连续工作 13 小时、自主调用工具超过 4,000 次。这些是 Kimi 自己声称的能力,不是独立的可靠性测试结果。

如果真能稳定跑起来,最直接受益的是那些日常工作本来就绕不开一堆乱文件和浏览器标签页的人:核对报告的分析师、啃论文的研究员、定期汇编材料的运营,还有把原始素材做成演示文稿的顾问。它的价值在于能跨应用把一件事做完,不用用户盯着每一步。

卡通智能体助手正在推动一个通宵的桌面工作流走向完成的报告,而另一个分支则遇到了文件冲突和权限障碍
无人值守的自动化之所以有用,正是因为没人盯着每一步。这也正是为什么第二天早上的记录如此重要。

权限不等于操作记录

Kimi 说有个“行动前询问”的保护机制,智能体要改文件、覆盖文件或跑代码之前会先请求授权。帮助中心还提到另一种设置——“允许全部”,智能体可以直接动手不用问。两种模式都有道理:一直弹确认框,定时任务就没意义了;完全放开,又等于把太多信任交给一个测试版产品。

但授权之后到底发生了什么,我还是得知道。提示框能告诉我智能体想编辑某个文件,但它没法告诉我:后来十个子智能体是不是都用了同一份过时的副本?浏览器步骤有没有真的提交了表单?一条没做完的研究分支是不是悄悄混进了最终的演示文稿?操作记录应该能直接回答这些问题,而不是让我从一堆零散输出里自己拼出整个过程。

质疑的声音集中在运维层面

公开讨论集中在实际落地的问题上。在一个Reddit 帖子里,有人问 Python 是不是跑在沙箱里,定时任务有没有可以回看的日志,智能体群怎么处理共享文件锁。一位评论者说得很直白:决定用户敢不敢让智能体自己跑的关键,就是操作记录。

TechRadar 对 Kimi 平台的独立评测在一次 Agent Swarm 研究任务里也踩到了类似问题。评测者说有几个子任务返回了不完整的结果,但没有明确标出来,输出还得人工复核。这只是一次评测,不是基准测试,也不是专门测 Kimi Work 的。不过这种失败模式值得注意——部分失败看起来像完成了,并行任务就越跑越让人不放心。

我希望第二天早上能看到什么

我最低限度想看到的记录包括:任务计划、每次工具调用、读写过的文件、浏览器操作、授予过的权限、子智能体的归属、失败和重试,以及从源文件到最终交付物的完整路径。文件改动要能 diff、能回滚。定时任务要有费用和运行时长上限。冲突发生时,受影响的分支应该停下来,而不是让最后写入的人赢。

我还想把“批准”和“审核”拆开。“允许访问这个文件夹”是开工前划定的范围;“接受这些改动”是看到证据之后做的质量判断。一个好用的桌面智能体两样都不能少,不然用户就只能在不断弹确认和盲信黑盒之间二选一。

Mark 正在查看一个语言中立的卡通操作记录,显示哪个智能体更改了每个文件、一个未完成的分支,以及一个最终批准的包
一份有用的操作记录能把智能体的活动变成可审核的工作成果:谁做了什么、哪里出了问题、最终交付物改了什么。

我的看法

Kimi Work 找对了方向。知识工作很少能靠一个提示框搞定,桌面智能体能消除聊天、文件夹、浏览器、脚本、电子表格和幻灯片之间那些别扭的切换。对我来说,定时工作功能比"300 个智能体"的宣传噱头更有意思,因为它改变了监督的时机。

所以我会用操作记录来评判 Kimi Work。智能体群可以完成一项复杂的任务,但仍可能留下某个薄弱环节或错误的文件改动让我心里没底。只有当能检查运行过程、撤销错误,并看清楚最终文件为什么值得批准时,我才会信任它。对于一个想整夜接管桌面的智能体来说,日志本身就是产品的一部分。

许可

新闻文本 © 2026 Mark Huang。 新闻文本可在非商业场景下分享或翻译,但需署名并链接到 https://markhuang.ai/zh/news/kimi-work-300-agents-need-receipts.

建议署名: 基于「Kimi Work 能同时跑 300 个智能体,但我得看到操作记录」(作者:Mark Huang),原文发布于 https://markhuang.ai/zh/news/kimi-work-300-agents-need-receipts。