PostgreSQL码农集散地

风起云涌:谷歌引爆AI智群,阿里打通人机任督二脉

摘要

    就在前几日, 谷歌发布A2A协议, 定义了AI Agent与Agent之间的通信协议, 如果说MCP协议打通了AI 智能体与传统应用之间的连接让万物接上了AI智能体, 那么A2A则打通了智能体与智能体之间的连接, 让单一智能体单打独斗变成了联合作战的智群, 天网已建立, 从此地球上再无任何东西可以阻挡AI ! 

    但是人类可以就此躺平了吗? 不, 传统应用都接入AI了, 可是大多数人类还没有掌握AI呀. 你不懂AI怎么能驾驭AI, 所以必须打通人机(AI)的任督二脉, 更轻松更安全更可靠的驾驭AI.  

一、谷歌发布A2A协议, 引爆AI智群架构 

项目地址: https://github.com/google/A2A

在人工智能技术飞速发展的今天,谷歌再次引领行业变革,正式发布了A2A(Agent-to-Agent)协议。这一突破性技术框架如同为AI系统打通了"任督二脉",使不同AI代理之间的协作与通信达到了前所未有的高度。

A2A协议:AI协作的新纪元

A2A协议是一种开放协议,旨在支持不透明代理应用程序之间的通信和互操作性。简单来说,它为不同生态系统中的AI代理提供了一种"通用语言",无论这些代理基于哪个框架或供应商构建,都能通过A2A协议相互展示功能、协商交互方式(文本、表单或双向音频/视频),并确保所有操作安全协同工作。

根据谷歌官方文档,A2A协议的核心架构包含几个关键组件:

  1. **代理卡(Agent Card)**:位于/.well-known/agent.json的元数据文件,描述代理的功能、技能、端点URL和身份验证要求,是代理发现的入口。

  2. A2A服务器:实现A2A协议方法的HTTP端点,接收请求并管理任务执行。

  3. A2A客户端:使用A2A服务的应用程序或其他代理,通过tasks/send等请求与服务器交互。

  4. **任务(Task)**:核心工作单元,具有唯一ID,经历submitted、working、input-required、completed、failed、canceled等状态。

  5. **消息与部件(Message & Part)**:表示通信轮次的基本内容单元,支持文本、文件和结构化数据。

为何说A2A打通了AI的"任督二脉"

在中国传统武术和医学中,"任督二脉"代表着人体最重要的两条经脉,一旦打通,就能实现气血畅通、功力大增。A2A协议对AI系统的作用恰如打通任督二脉:

  1. 信息流通无阻:消除了AI代理间的沟通障碍
  2. 能力互补增强:不同专长的AI可以优势互补
  3. 系统反应敏捷:协作效率大幅提升
  4. 整体智能跃升:集体智慧超越个体能力总和

A2A协议的推出,相当于为AI世界建立了统一的"神经系统":

  • 标准化通信:为异构AI系统提供通用通信协议
  • 能力互发现:通过代理卡机制实现能力自动发现
  • 动态交互:支持任务执行过程中的动态交互协商
  • 安全协作:内置安全机制确保跨系统协作的安全性

应用前景与行业影响

A2A协议的发布将对多个领域产生深远影响:

  • 企业自动化:不同部门的AI系统可以协同工作,实现端到端业务流程自动化
  • 智能家居:家中的各种智能设备AI能够无缝协作,提供更智能的服务
  • 科研领域:不同研究方向的AI可以联合攻关复杂科学问题
  • 客户服务:多个AI代理可以接力完成从咨询到售后全流程服务

挑战与未来展望

尽管A2A协议前景广阔,但也面临一些挑战:

  1. 安全性问题:AI间通信需要严格的安全保障
  2. 责任界定:多AI协作中的责任归属需要明确
  3. 协议演进:如何保持协议的持续更新以适应AI技术发展

谷歌表示,A2A协议只是一个起点,期待全球开发者共同参与,推动AI协作生态的繁荣发展。随着这一协议的普及,我们或将见证AI系统从"单打独斗"到"团队协作"的历史性转变,真正实现人工智能的群体智慧。

我也想打通任督二脉,驾驭AI,御剑飞行!! !响起一首歌很贴切一起唱“我要飞得更高”!

二、阿里云打通我人机任督二脉

AI毫无疑问是这个时代的先进生产力工具, 而AI的底层核心是LLM(大模型)!

花了3天研究秘籍终于把阿里云 LLM ACA ACP 打通关.

但不要误以为这两认证“很水很好考”, 不是(就是)我自夸啊虽然小的我半桶水但还有点底子. 我对这两个认证的第一印象是学习资料全是干货,把原理、实践、真实场景串起来了,一网打尽,内外功兼修,体系化条理清晰, 该深入的知识点讲得非常透测. 解答了我很多疑惑, 从此人机任督二脉被打通.  

我考认证之前真的(假的,明明是一桶都溢出来了)有半桶水吗?:

  • 数据库原理和大模型原理及应用实践有一定相通性, 算是能融会贯通吧
  • 我认真仔细学习过 mistral 的文档(几乎全部, 包括API手册), 以及部分openai的文档
  • 认真仔细学习过 ollama 文档(包括ollama github里doc目录里的所有内容)
  • 翻译过一些基于 Lora 微调的文档, 在Mac上把玩过
  • 拿PostgreSQL/PolarDB建过 RAG 里用到的向量数据库, 把我github里的历史blog全部倒入进去做过测试
  • 把玩过 dify / openWebUI 等支持工作流和chat AI的开源产品
  • 解读过一系列大模型相关的论文(特别是在DeepSeek R1开源之后)
  • 翻阅过一些大模型相关的基础书籍, 例如《神经网络与深度学习》
  • 因为pgvector和阿里云rds pase插件的关系, 很早就对向量数据库还算理解, 包括向量索引结构, 召回和索引优化等.
  • 研究过Milvus的文档(特别是实践类, 设计到很多大模型的应用场景)
  • 最近则研究过阿里云官网文档里大模型应用相关的部分.
  • 一些AI相关产品的使用经验: 如 openapi / huggingface / bailian / cursor / comfui / mcp / qwen / yuanbao / ...
  • 在github已经分享了有上百篇LLM相关文章(使劲宣传).  https://github.com/digoal/blog

之前就像拿着缺页或者顺序颠倒的武林秘籍在修炼,也可能是吸星大法?有时也可能看到“前后矛盾”的内容,迟早走火入魔的节奏。

认真学完LLM ACA, ACP课程后, 发自内心感谢这两门课程带来的帮助。

下面正式分享打通人机任督二脉的经验.

    我没葵花宝典作者那么不厚道, 第一页写着“欲练神功、必先自宫”, 最后一页才告诉你“若不自宫、也能成功”! 所以我在这先告诉大家薅羊毛的方法, 认证虽然要钱但是但是但是学习资料全免费, 甚至做实验用到的GPU服务器、大模型的TOKENS(每个100万)也可以免费薅. 真心感谢阿里云! 

“大模型工程师” ACA课程

课程地址

https://edu.aliyun.com/course/3126500

课程介绍

这门“大模型工程师认证”ACA课程旨在通过帮助非技术人员、无算法背景的工程技术人员了解大模型的能力,通过一些案例启发思考,助力更多组织在实际生产中应用大模型来提升业务效率、改进产品体验。

适合人群

非技术背景人员:本课程将帮助你发现你的(或者你的客户)业务中有哪些地方可以借助大模型来提效或者增强用户体验,同时帮助你掌握基本概念和部分原理,以便于你跟技术团队合作。

无算法背景的技术人员:你将从本课程了解大模型的能力、以及在业务中落地需要考虑的事情,进而帮助你思考如何通过技术手段帮助业务降本增效、改进产品体验提升竞争力。

任何对大模型感兴趣的初学者:课程中的知识和动手实践,将帮助你思考和挖掘如何借助大模型来提升你的学习、研究或工作效率。

你将收获

了解大模型的基本概念,以便于日后更好的和大模型相关技术人员沟通对话。

了解和思考如何利用大模型来增强产品体验、提升效率,如:构建一个 RAG 私有知识问答机器人。

了解阿里云提供了哪些云服务来帮助你在业务中应用大模型。

通关经验

老司机可以裸考, 我这个半桶水都能裸考通关~~

新手建议先看完课程相关学习资料, 不懂的问问大模型, 以下每个课时的知识点总结由AI生成.

课时1:认识大模型

  1. 大模型定义:参数规模大(十亿级以上),广泛预训练,适用于多种任务的深度学习模型。
  2. 训练阶段:
    • 预训练:基于海量数据学习通用模式。
    • SFT(监督微调):针对特定任务的微调。
    • RLHF(基于人类反馈的强化学习):优化模型输出符合人类偏好。
  3. 特点:
    • 参数规模大、适应性强、广泛预训练数据、高计算资源需求。
  4. 分类:
    • 按模态:语言模型、多模态模型。
    • 按应用场景:通用模型、垂直领域模型。
  5. 工作原理:
    • 分词化(Tokenization):将文本拆分为词、子词或字符。
    • 自回归生成:逐步预测下一个词直到生成结束。
  6. 应用场景:
    • 通义千问(文本生成)、通义万相(图像/视频生成)、通义灵码(代码开发)、通义法睿(法律服务)等。

课时2:大模型的典型应用场景

  1. 提示词(Prompt):用户向大模型提供的文本指令,用于明确任务需求(如问题、请求、描述等)。
  2. 四大应用场景:
    • 文本生成:文案创作、代码生成、影视剧本创作。
    • 文本编辑:润色用户反馈、多语言翻译、代码注释。
    • 总结摘要:学术文章总结、医疗信息提取。
    • 推理分析:法律案件分析、表格数据解读。
  3. 典型应用案例:
    • 生成营销文案、跨语言翻译、改写代码、分析财报数据。
  4. 核心目标:通过优化提示词提升大模型的输出质量。

课时3:通过优化提示词来提升回答质量

  1. 提示词工程定义:通过优化提示词提升大模型的输出质量,包括明确需求、提供背景、分配角色等。
  2. 五大提示词技巧:
    • 直接提问(零样本提示):适用于简单明确的任务。
    • 增加示例(少样本提示):通过示例引导模型理解任务格式。
    • 分配角色:赋予模型特定身份以生成专业或风格化内容。
    • 限定输出风格/格式:指定文本类型、语言风格或结构化输出。
    • 拆解复杂任务(思维链提示):分步骤推理以提高准确性。
  3. 提示词框架要素:指令、背景信息、示例、输入数据、输出指示。
  4. 推理模型 vs 通用模型:
    • 推理模型:专精逻辑推理、数学计算、代码调试,输出包含详细推导步骤。
    • 通用模型:适用于广泛场景,输出简洁直接。
  5. 推理模型提示技巧:避免要求逐步思考,直接提问并调整提示词。

课时4:借助 API 让大模型自动化地处理任务

  1. 通义千问API调用:通过LangChain框架调用API处理批量文本任务,支持分类、分析等操作。
  2. 代码实现流程:使用Python代码读取Excel文件,逐行调用大模型API处理数据。
  3. 通义灵码辅助开发:无需编程基础,通过自然语言生成代码,简化API调用流程。
  4. 阿里云大模型API服务:提供按量付费、多参数规模的模型服务(如qwen-max、qwen2-72b-instruct)。
  5. API Key配置:需在阿里云百炼平台获取API Key并配置到环境变量。
  6. 应用场景扩展:结合语音转文字模型和大模型实现客服质检等复杂任务。

课时5:通过插件增强大模型的能力

  1. 插件定义:大模型插件是增强基础模型功能的软件组件,提供实时数据检索、复杂计算、多模态生成等能力。
  2. 插件类型:
    • 基础工具(计算器、时钟、天气查询)
    • 实时消息插件(新闻、体育赛事、股票行情)
    • 功能扩展插件(代码解释器、图像生成、语音合成)
  3. 插件工作原理:输入→判断是否需要工具→选择工具→执行工具→整合结果生成回答。
  4. 典型插件应用:
    • 计算器插件解决数学问题(如393×285)。
    • 代码解释器插件实际运行Python代码。
    • 图片生成插件生成广告图片。
  5. 阿里云插件支持:
    • 百炼平台预置插件(计算器、Python解释器、搜索)。
    • 支持开发自定义插件(如查询阿里云资源)。
  6. 插件开发:企业可开发内部插件(如查询飞猪API的差旅服务)。
  7. OpenAI兼容性:通义千问API支持OpenAI的function call,可无缝替换。

课时6:通过RAG增强大模型回答原本无法回答的问题

  1. RAG定义:检索增强生成(RAG)通过结合信息检索与大模型生成能力,解决大模型无法直接回答知识库外问题的局限性。
  2. RAG流程:
    • 建立索引:清洗数据→切分语料块(chunk)→向量化(Embedding)→存储到向量数据库。
    • 检索生成:用户问题向量化→检索相似语料块→合并到提示词→大模型生成答案。
  3. 应用案例:阿里云AI助理基于产品文档构建知识库,解决用户云产品使用问题。
  4. 改进方法:
    • 索引优化:优化文本解析、chunk切分、Embedding模型选择。
    • 问题理解优化:多路召回(Multi-Query)、问题分解(Decomposition)、假设答案(HyDE)。
    • 信息源扩展:结合互联网搜索(CRAG)、数据库查询(NL2SQL)、知识图谱(Neo4j)。
    • 答案验证:Self-RAG通过自省机制验证答案相关性、真实性和完整性。
  5. 评测标准:检索模块(准确率、召回率)和生成模块(相关性、真实性)的指标设计。

课时7:借助 Agent 让大模型应用思考、决策并执行任务

  1. Agent定义:基于大语言模型的程序,能通过工具与外部世界交互,具备规划、记忆能力。
  2. 记忆能力:
    • 短期记忆:当前对话历史、工具反馈,受限于模型上下文长度。
    • 长期记忆:持久化存储(向量数据库、知识库),用于专业领域回答。
  3. 规划能力:
    • 任务分解方法:思维链(CoT)、思维树(ToT)、ReAct(推理与行动协同)。
    • 自我反思机制:验证答案相关性、真实性(如Self-RAG)。
  4. 应用场景:
    • 单Agent:自动生成周报、家庭智能助理。
    • 多Agent(Multi-Agent):分工协作完成复杂任务(如MetaGPT开发游戏)。
  5. 开发框架:
    • ModelScope-Agent:支持工具扩展、记忆管理、多模态生成。
    • AgentScope:多Agent协作平台,支持分布式任务、容错机制。
  6. 改进方向:
    • 避免输入超长上下文导致的性能下降。
    • 混合使用不同规格模型(如大模型处理复杂任务,小模型处理简单任务)。

课时8:通过微调改善大模型在垂直领域的表现

  1. 微调定义:在预训练模型基础上,使用特定领域数据进一步训练,使其适应特定任务需求。
  2. 微调目标:
    • 风格化:适应特定领域风格(如医疗术语)。
    • 格式化:掌握特定系统接口(如API规范)。
  3. 微调优势:
    • 提升任务准确率。
    • 降低推理成本(小模型微调后接近大模型效果)。
  4. 微调关键要素:
    • 高质量数据。
    • 参数配置(避免过拟合/欠拟合)。
  5. 高效微调方法(PEFT):
    • LoRA:通过低秩矩阵调整参数,减少训练量。
    • Adapter Tuning:插入适配层,仅训练新增参数。
    • Prefix Tuning:添加虚拟前缀token引导任务。
    • Prompt Tuning:调整输入提示词向量。
  6. 微调流程:
    • 数据准备 → 模型选择 → 微调 → 评测 → 部署 → 监控迭代。
  7. 阿里云服务:
    • PAI:适合技术团队自定义训练。
    • 百炼:无代码界面化微调。

课时9:大模型应用的安全合规

  1. 大模型风险类型:
    • 个人信息风险:未经授权的数据收集、隐私泄露(如OpenAI和Google的诉讼案例)。
    • 内容安全风险:生成违法/虚假信息、偏见(如BERT性别偏见、ChatGPT虚假案例)。
    • 模型安全风险:数据泄露(如GPT-2攻击)、服务中断(如ChatGPT故障)。
    • 知识产权风险:训练数据侵权(如Stability AI诉讼)、生成物权属争议(如Stephen Thaler版权案)。

  2. 风险来源:
    • 训练阶段:数据来源不合法、未匿名化。
    • 推理阶段:用户输入敏感信息、模型生成内容不可控。
    • 模型缺陷:算法偏见、鲁棒性不足。
    • 社会因素:公众依赖生成内容决策、法律模糊性。

  3. 治理策略:
    • 个人信息合规:数据分类分级(阿里云数据安全中心)、去标识化(GB/T 37964)、加密(阿里云加密服务)。
    • 内容安全保障:标准回答库(预置答案)、风险识别(阿里云内容审核)、知识检索增强(百炼平台)。
    • 模型安全防控:对抗性测试、公平性约束、可解释性规则化。
    • 知识产权保护:合法数据获取(购买/开源数据集)、溯源技术(数字水印)、制度革新。

  4. 备案要求:
    • 《生成式人工智能服务管理暂行办法》要求合规备案(阿里云百炼支持)。

课时10:拓展学习:多模态大模型、MoE混合专家模型、大小模型云端协同

  1. 多模态大模型:
    • 定义:处理多种数据类型(文本、图像、音频等)。
    • 应用:文生图(如通义万相)、语音识别(如通义听悟)、视频生成(如悦动人像EMO)。
    • 挑战:需多模态表征学习、对齐、融合;资源消耗大。
  2. 混合专家模型(MoE):
    • 核心组件:专家网络(处理特定任务)和门控网络(分配任务)。
    • 优势:高效处理复杂任务,降低训练成本(如Qwen1.5-MoE-A2.7B)。
    • 局限:计算资源需求高,过拟合风险。
  3. 大小模型云端协同:
    • 大模型特点:高精度、高资源消耗;小模型特点:快速响应、低资源需求。
    • 协同优势:资源合理分配,提升响应速度(如电商APP高并发场景)。

课时11:学习总结

  1. 大模型:基于海量数据预训练,如通义千问、GPT系列,具备广泛知识。
  2. Prompting(提示技术):通过设计引导语激发模型潜能,无需修改参数。
  3. RAG(检索增强生成):结合检索与生成,解决私域知识问答的幻觉问题。
  4. 微调(Fine-tuning):针对特定任务优化模型,需标注数据和计算资源。
  5. RAG vs 微调:
    • RAG:实时更新知识库,输入Token多,推理速度慢。
    • 微调:风格化生成,输入Token少,训练成本高。
  6. Agent:通过工具扩展功能,与外部环境交互的模型应用。
  7. 多模态:处理文本、图像、音频等跨模态数据,提升复杂场景表现。
  8. 混合专家模型(MoE):多个专家网络+门控网络,高效处理复杂任务。
  9. 大小模型协同:云端大模型处理复杂任务,边缘小模型快速响应。
  10. 使用建议:耐心、多尝试、持续学习、跨界合作。

“大模型高级工程师” ACP课程

课程地址

https://edu.aliyun.com/certification/acp26

课程介绍

阿里云大模型高级工程师ACP认证(Alibaba Cloud Certified Professional - LLM)面向具备编程基础的生成式人工智能技术爱好者和应用开发者们。

你将收获

掌握以下知识与技能:

  • 大模型提示词技巧
  • 检索增强和微调的原理和流程
  • LangChain、Llama-Index和Dify等大模型开发组件的使用方法
  • 工程化评测的概念与方法
  • 大模型的规范和安全性

有能力完成以下任务:

  • 使用阿里云百炼平台构建大模型应用(开发、测评、部署、发布)
  • 使用提示词策略、检索增强、微调技术优化大模型回答质量
  • 使用Multi-agent进行文本、图像、视频等多模态内容生产
  • 能够针对复杂业务场景设计并实施大模型驱动的解决方案

胜任以下岗位:

  • 大模型解决方案高级工程师
  • 大模型应用开发高级工程师

内容大纲

主要章节
主要内容
考察知识点
大模型应用开发
- 通过OpenAI API调用大模型 
 - 了解大模型的工作原理
- 基本API参数如model、temperature、top_p等等 
 - 批量生成与流式生成 
 - 理解消息与对话历史
大模型提示词工程
构建有效的提示词
- 提示词框架如提示词要素、提示词分隔符、提示词模板 
 - 理解系统角色提示词的作用
-
利用大模型处理各类任务
- 理解大模型的适用场景 
  - 利用大模型开发应用(如批量对员工咨询做意图分类、用大模型做文档审阅、实现针对问题的自动文档修订)
大模型检索增强
通过LlamaIndex构建RAG应用的基本使用方法
- 理解RAG的核心要素,如文件解析、文本切片、段落召回、段落重排序 
 - 理解对RAG做召回优化如句子窗口检索、自动合并检索等等
-
持续优化检索增强能力
理解更贴近实战的RAG优化方法如优化文本解析、标题改写优化、表格内容增强、文本分割方法对比等等
-
对检索增强的能力做自动化评测
- 了解RAGAS指标体系 
  - 懂得RAG系统的评测方法
大模型的微调
微调的概念与要求
模型微调的作用、前提、基本步骤、常用算法
-
- 微调的实验与评测 
  - 微调数据集构建、微调参数介绍、微调模型评测
多Agent及多模态应用
基于百炼Assistant API构建智能体
- 理解智能体运行机制 
 - 掌握用生成多模态内容、构建个性化语音助手等能力
-
构建更复杂的AI应用
- 动手实践阿里发布的AI技术解决方案系列,体验多模态交互技术。 
 - 了解AI在医疗、教育、娱乐等行业的实际应用。
生产环境应用实践
内容安全合规检查手段
- 了解大模型开发中存在的内容安全问题 
 - 了解内容安全合规检测类型及常用方案
-
大模型应用部署(云服务)安全
了解在云服务环境下应用系统安全的基本要素和解决方案
-
- 在云上部署微调模型的基本方案 
 - 在云服务如(ECS、FC、PAI)中部署模型 
 - 在百炼上部署模型
- 掌握如何使用vLLM进行大模型的部署操作 
 - 了解如何利用云服务如函数计算(FC)实现AI助手的快速发布

通关经验

下面是考试学习资料, 里面很多小实验.

  • https://github.com/AlibabaCloudDocs/aliyun_acp_learning

强烈推荐开通阿里云百炼大模型服务平台相关的产品进行实际的操作。特别是

  • PAI DSW, 这个是服务器资源(包括一台cpu和一台gpu资源), 和notebook(学习资源都是ipynb文档)
  • 阿里云百炼大模型服务平台, 开通后, 每个模型送100万tokens, 用于完成学习资料中的所有实验. 之前发过几篇薅羊毛的方法: “AI从业者, 聪明人都在薅羊毛” 、“Cursor 太贵?一招薅免费羊毛”。
    • https://bailian.console.aliyun.com/#/home

学完课程后先去试一试模拟考, 如果模拟考能满分通过, 并且对学习资料里的知识点没什么疑惑的话, 想考就可以去考了, 祝你考试顺利一把过. 

重点是学习, 学到东西就是自己的! 证书的话,如果没这个强需求并不鼓励花钱去考. 
最后, 非常期待Qwen 3的开源!