AI 智能体实践

89 篇文章
Prompt Injection无解之谜:模型分不清「你是谁」和「你什么角色」
2026-06-24 8 分钟

Prompt Injection无解之谜:模型分不清「你是谁」和「你什么角色」

📰 本文选自 自游人今日AI科技日报 一个四年无解的漏洞 Prompt Injection(提示词注入)从2022年被发现至今,始终占据OWASP LLM Top 10威胁榜首[^1]。四年过去了,没有任何单一技术能根治它——不是因为安全社区不努力,而是因为它不是代码漏洞,是架构级别的结构性缺陷。 …

PromptLLMAgent
Qwen-AgentWorld上手指南:用语言世界模型训练Agent
2026-06-24 7 分钟

Qwen-AgentWorld上手指南:用语言世界模型训练Agent

📰 本文选自 自游人今日AI科技日报 Agent训练的范式转换 训练AI Agent一直有个麻烦:你得给它真实的环境去交互。想让Agent学会用终端?搭个沙箱。学会操作浏览器?开个Chromium。学会用操作系统?配个虚拟机。每种环境都要配一套独立的执行引擎——开发成本高、速度慢、还容易出错。

Agent大模型LLM
Sakana Fugu深度解析:7B小模型如何编排出顶级性能
2026-06-24 6 分钟

Sakana Fugu深度解析:7B小模型如何编排出顶级性能

📰 本文选自 自游人今日AI科技日报 一个小模型凭什么叫板Fable 5 2026年6月22日,东京创业公司Sakana AI发布了Fugu——一个多智能体编排系统。跑分数据相当炸裂:LiveCodeBench 93.2分(Fable 5是89.8分),GPQA Diamond 95.5分 …

大模型Agent评测
Self-Harness:让AI Agent学会自我修复的框架
2026-06-24 7 分钟

Self-Harness:让AI Agent学会自我修复的框架

📰 本文选自 自游人今日AI科技日报 Agent的上限在Harness,不在模型 AI Agent领域2026年有个越来越明确的共识:一个Agent在真实任务里能不能跑顺,核心决定因素不完全是模型本身。系统提示怎么写、工具怎么暴露、错误怎么恢复、什么时候验证中间产物、什么时候停止无效探索——这些围 …

AgentLLMAI技术教程
VibeThinker-3B 深度解析:3B 参数凭什么打平千亿模型
2026-06-21 5 分钟

VibeThinker-3B 深度解析:3B 参数凭什么打平千亿模型

📌 一个 3B 参数的小模型,在你笔记本上跑起来,推理能力跟 GPT-5.5 五五开。这不是标题党——这是 2026 年 6 月 arXiv 上那篇震惊 AI 圈的 14 页技术报告说的。

VibeThinker-3B小模型开源模型
斯坦福 DeLM:去中心化多 Agent,成本砍半的架构秘密
2026-06-21 4 分钟

斯坦福 DeLM:去中心化多 Agent,成本砍半的架构秘密

📌 “Shared failures, verified gists, no boss”——这是斯坦福团队给多 Agent 协作的新定义。让 Agent 们共享失败经验、自发协作、不要中心控制器。成本直接砍半。

DeLM多AgentAgent架构
24小时连失两员大将:谷歌AI人才为何加速流向OpenAI和Anthropic
2026-06-20 5 分钟

24小时连失两员大将:谷歌AI人才为何加速流向OpenAI和Anthropic

📰 本文选自 自游人今日AI科技日报 引言 6 月 17 日到 6 月 20 日之间,谷歌 DeepMind 发生了两件事:

AI人才DeepMindAnthropic
Datasette Apps:把 Claude Artifacts 塞进数据库
2026-06-20 3 分钟

Datasette Apps:把 Claude Artifacts 塞进数据库

📌 Simon Willison 说这是他"多年 vibe-coding 实验的产品化"。他把 Claude Artifacts 的交互模式和一个持久化的 SQLite 数据库连在了一起——这意味着独立开发者可以用 AI 搭数据产品了,零门槛。

DatasetteSimon WillisonClaude Artifacts
DeepSeek 510亿A轮融资全解析:谁投了、怎么投、为什么是现在
2026-06-20 5 分钟

DeepSeek 510亿A轮融资全解析:谁投了、怎么投、为什么是现在

📰 本文选自 自游人今日AI科技日报 引言 6 月 16 日,企查查上一则不起眼的工商变更,标志着中国 AI 行业史上最大单笔融资正式落地:DeepSeek(杭州深度求索)完成首轮外部融资约 510 亿元人民币,投后估值逼近 4000 亿。

大模型DeepSeek开源
GLM-5.2 开源全解析:评测数据、部署成本、竞争格局
2026-06-20 4 分钟

GLM-5.2 开源全解析:评测数据、部署成本、竞争格局

📌 上一个能在编程能力上跟闭源最强模型正面竞争的开源模型是什么时候?Llama 3。它跟 Opus 之间差了至少一个身位。GLM-5.2 把差距拉到了 4 个百分点——这是开源代码模型第一次真正进入 “能当开发同事” 的序列。

GLM-5.2开源模型代码模型

发现新版本

当前站点有新版本可用。