体坛随行记
2026-08-19 13:42来自 其他

围棋AI是如何学习和进步的?

  柯洁近日因一段“装弱智赢AI”的旧视频再度冲上热搜,表面看是人类用“耍赖”找到了AI的命门,实则这段视频出自三年前,而人类棋手当时靠的正是利用AI对“非理性下法”的认知盲区,在特定条件下短暂翻盘。

  一、AI为何会被“装弱智”骗过

  默认对手理性的假设:主流围棋AI的学习基于海量人类高水平对局棋谱,其模型隐含着一个前提——对手会按“最优解”理性行棋。

  偏离“最优”的招法干扰评估:当人类故意下出“一路爬行”“自填眼位”等看似巨亏的非理性招法时,AI因训练数据中极少出现此类局面,概率评估模型会失效,甚至无法判断自己大龙已死。

  本质是“训练盲区”而非算力不足:柯洁将AI比作“极端聪明却未经世事的天才少年”,它能计算千万变化,却不理解人类的“欺骗性”打法。

  二、AI是如何通过数据与对弈学习的

  初始学习阶段:早期主流围棋AI通过分析人类高手棋谱,模仿学习人类数千年的棋路与定式,形成“最优应对”的直觉基础。

  自我对弈进化阶段:以AlphaGo Zero为代表的进阶AI,摆脱人工棋谱,通过自我对弈“左右互搏”强化学习,从随机落子开始不断试错迭代,最终棋力超越人类,也因此不依赖固定套路,更难被“装弱智”欺骗。

  迭代修复机制:人类找到漏洞后,AI开发方会针对性升级修复。2023年“绝艺”被芝野龙之介抓住大龙死活判断盲区连赢三盘,修复后立即反杀三盘。

  三、人类用“逆向思维”找到的破解窗口

  非标准棋形触发认知裂缝:人类棋手有意将局面导入AI训练数据覆盖不到的复杂盲区,迫使它在不熟悉的局面中做出错误判断。

  “把水搅浑”的乱战策略:柯洁在2026年王中王赛上用AI不会推荐的“变招”主动制造劫争,在绝境中等待对手(而非AI)犯错,实现从1.4%胜率到屠龙逆转。

  机会窗口正在关闭:人类找到AI漏洞的战术,往往随AI系统修复而迅速失效;且这类破解多针对特定商用版本,对采用自我对弈训练的顶级AI难以奏效,未来正式比赛中分先击败AI的机会或愈发渺茫。