工具调用
-
大模型竞争从跑分转向持续工作能力:企业评估智能体应增加哪些指标?
大模型竞争正从跑分转向真实业务中的持续工作能力,单轮准确率已无法回答“智能体能否完成一项真实工作”。文章聚焦企业评估智能体时应增加的六类关键指标,并给出三层测试法:先测模型基础能力,再测工作流闭环,最后进入受控生产环境。当“答得好”只是起点,“做得成、跑得稳、管得住”才是价值终点,你的评估体系跟上变化了吗?
-
AI智能体接入企业工具链,权限最小化应如何设计?
AI智能体接入数据库、API和自动化工具后,权限失控的后果远超回答错误:客服Agent可能误删订单,运维Agent可能执行不可逆操作。文章提出将最小权限原则扩展至智能体场景,围绕任务、工具、数据和操作风险四维度分层授权,并详解按任务粒度发证、工具操作分级、短期令牌隔离、高风险动作人工确认及异常撤销审计等落地机制。权限最小化如何在效率与安全之间取得平衡?
-
9月13日AI产业观察:模型能力进入“深水区”,企业如何从追求参数转向追求任务闭环?
当模型参数不再足以解释能力增长,企业真正焦虑的已不是“谁更强”,而是AI能否理解目标、调用工具、处理异常并对结果负责。文章从目标理解、工具调用、多步骤规划、结果验证、异常处理和经营指标六个维度,拆解智能体如何嵌入任务闭环,并给出先选任务、再选模型的落地路径:企业该如何避免“会对话却不干活”?
-
OpenAI开放Agents API:企业接入智能体前,先核对哪些能力与权限边界?
OpenAI推出的Agents API将编排与执行基础设施集成于云端,看似极大降低了智能体构建门槛,但企业若将其等同于可独立经营的“AI员工”,将面临严重的权限失控与成本风险。从托管沙箱到子智能体并行,平台能力并不等同于业务稳定性。面对模型调用、工具权限、数据隔离、成本核算及审计追责这五大边界,企业如何在追求自动化效率的同时,构建一套可撤销、可审计的风险防线?
-
香港发布HKGAI V3及生产力级超级智能体:企业如何评估“长流程自主执行”能力?
香港发布 HKGAI V3 及生产力级超级智能体,其核心突破在于能无人工干预稳定运行 28 小时,将 AI 从“能聊天”推向“能交付结果”的长流程自主执行。然而,长时间运行与本地训练并不等同于业务全自动,企业在选型时面临任务拆解、工具调用及数据合规等复杂挑战。面对这种能力跃迁,企业应如何通过任务成功率、人工介入次数等五项评估框架,验证智能体是否真正具备进入生产流程的可靠性?
-
AI智能体进入生产环境后,企业如何搭建可观测性与故障回溯体系?
AI智能体进入生产环境后,最棘手的并非“能否回答”,而是错误结果能否解释、复现与止损:传统接口监控难以定位上下文漂移、工具异常或协作循环。文章提出以统一链路和跨度还原执行过程,分层保存提示词与工具数据,并结合质量评估、成本核算、权限审计和故障回放,企业如何把这些机制真正落到生产系统?
-
DeepSeek V4.1 Flash发布:原生视觉、MoE与KV缓存如何影响企业模型选型
DeepSeek V4.1 Flash采用原生视觉与MoE架构,输入、输出阶段分别激活约80亿和160亿参数,并以较小KV缓存支持长上下文与高并发。企业选型不能只看5520亿总参数,还应综合权重显存、专家通信、视觉输入、缓存管理及端到端成本,在目标硬件和业务负载下实测。
-
智能体AI算力采购不能只看GPU:如何评估CPU、内存与工具调用链?
智能体AI算力采购不能只看GPU型号与峰值吞吐,CPU调度、内存带宽和工具调用链往往才是瓶颈。评估应围绕完整任务耗时与尾延迟展开,核心数多不等于工作流更快,需按链路考察数据搬运和一致性问题。
-
智能体进入工程化竞争期:企业评估工作流自动化方案要看哪些技术条件?
智能体进入工程化竞争期,竞争重点从模型参数规模转向真实流程中的稳定性与可核验价值。企业应先判断任务是否适合智能体,再评估工程化技术条件,重点考察任务编排、工具调用、知识接入、权限安全、全链路监控,并让真实反馈回流评测集,形成持续改进闭环。
-
智能体身份管理国标启动立项:AI从“会办事”走向可授权交易,企业该先补哪些信任机制?
【软盟资讯·新闻导读】截至现有公开资料,智能体身份管理的关键进展并非2026年9月10日前后“启动立项”,而是5月22日获批准、6月26日公开发布的《人工智能 智能体互联》系列国家标准化指导性技术文件,其中包含身份码和身份管理部分。它释放的…
-
AI模型服务价格变化后,开发者该如何重新计算应用的单位经济模型
GLM-5.3-Flash价格调整后,应用成本不能只按模型报价和调用量推算。开发者应以完成一次任务为单位,分别记录输入、输出与缓存命中,并纳入失败重试、工具调用和人工复核成本,重新评估真实毛利与预算。
-
蚂蚁推出Ling-3.0-flash-Fin:金融增强模型如何服务长程研究型智能体
蚂蚁发布金融增强模型 Ling-3.0-flash-Fin,采用稀疏混合专家架构,总参数1240亿,支持256K上下文,面向金融研究型智能体。文章强调其落地仍需垂直训练、证据核验、工具调用与人工审核。
