1956 年,黑龙江。你在生产队割麦子,一把镰刀,每天割一亩多地。
Say It, Get It Done: AI Agents in Social Science Research
第15届 · 应用社会科学研究方法研修班
《数据分析专题》系列讲座
2026 年 7 月 22 日
你的研究,有多少时间花在文献、
归档、制表、作图、撰写等“体力劳动”上?
所有需要重复的劳动,都是体力劳动。
Claude Code 发展史
METR 研究:AI 可处理任务时长 ≈ 每 7 个月翻倍,2025 初 1 小时 → 2026 末 8 小时
Automated Weak-to-Strong Researcher (AAR):Anthropic 让 Claude Opus 4.6 自主提出假设、设计实验、迭代解决一个真实的 AI 研究问题。(2026年4月)
人类研究员
Anthropic 两位作者
Agent 团队
9 个 Opus 4.6 并行
累计约 800 小时、约 $18,000 算力,AI 在真实 AI 研究任务上显著超过模型公司自家研究员的人类基线。
180 天 传统研究
60 天 借助 Chatbot
20 天 借助 AI Agents
参考框架:一位教授完成一项高质量研究,同期可并行推进 2–3 个项目。
一项研究的周期越长,往往智能体越重要。
智能体需要电脑技术,但它将革命性地杀死电脑技术。
🏢 AI 公司
OpenAI
Anthropic
Google
DeepSeek
Moonshot
💬 聊天机器人
ChatGPT
Claude
Gemini
DeepSeek
Kimi
🔧 AI 应用
NotebookLM
Gamma
Elicit
Consensus
Notion AI
💻 IDE
VS Code
Cursor
Windsurf
Antigravity
Trae
🤖 终端智能体
Claude Code
Codex
ZCode
Kimi Code
Qwen Code
⚙️ 智能体内部
Memory
Skill
Agent
Hook
MCP
今日聚焦:终端智能体,当前最强的 AI 门类,右侧的智能体内部概念是它们强大的秘密。
Georgia Tech Polo Club · Transformer Explainer(需联网)· 打不开就直接访问:https://poloclub.github.io/transformer-explainer/
基座模型 · 只会续写
对话模型 · 懂得回答
Ouyang et al. (2022). InstructGPT, NeurIPS · DeepSeek-AI (2025). DeepSeek-R1 · Raschka (2024). New LLM Pre-training and Post-training Paradigms
Stata 命令窗口
输入命令 → 操作数据
终端(Terminal)
输入命令 → 操作整台电脑
pwd 我在哪 · ls 有什么 · cd 去哪里
上面是 Mac/Linux 的命令;Windows PowerShell 里几乎一样(ls、cd 通用)。
大多数工具没有图形界面,只提供一个命令名:
git · 代码文件的“后悔药”
stata · 在终端跑 do-file,不用打开软件
stata 命令需提前加入 PATH(自行配置一次即可)
你以后要用的 AI 工具,也是这样一个命令名。
只不过下命令用的是口语。
界面为示意,实际版本略有出入 · Codex、Kimi Code、ZCode 等同理:codex、kimi 各是一个命令名
全局视野
同时看到脚本、数据、文稿,不再粘贴片段
自动排错、端到端执行
直接修改 bug,全程无需操作
不只是回答问题,而是真正完成工作。 自动化体力劳动,把时间交给脑力劳动。
Agent 不会一次性加载一棵树,它只会摘几片叶子。
紫色 = 加载,灰色 = 跳过。Agent 只把相关的知识放进“工作记忆”,大幅节省上下文空间。
你说:
整理上海弄堂社区的文献。
Agent 做的事情:
输出:
时间:< 5 分钟
你说:
报告统计年鉴数据每个年份和省份的缺失情况。
Agent 做的事情:
输出:
时间:< 10 分钟
选一个研究任务,点「让 Agent 试试」,看它如何规划。(本地模拟,无需联网。)
你说:
做一套15页的幻灯片。
Agent 做的事情:
输出:
时间:< 15 分钟
你说: 按照 ASR 标准润色论文。
5 类审查员并行运行: 期刊格式 · 论文结构 · 语法 · 文献引用 · 图表
输出: 修改后论文 + 每轮修改日志
时间:< 30 分钟
场景一:加速,经验丰富的学者 + Agent = 三天完成一篇关于上海社区治理的 CSR 实证论文。
陈老师的条件
Agent 的三个角色
① Day 1 · 数据分析
Agent 承担数据分析师角色。
② Day 2 · 文献综述
Agent 承担文献助理角色。
③ Day 3 · 论文初稿
Agent 承担论文写手角色。
陈老师审阅结果,驾驭方向(harness),而 Agent 承担全部执行工作。
场景二:赋能,一个电脑技术高超、不擅英文的理科生,也能写出 ASR 水平的引言。
理论上,学术写作的节奏、语气、文风、气质,都可以从现有论文中学习。
传统路径
读研究生 → 大量阅读 → 摸索写作风格 → 数年后上手
Agent 路径
下载论文 → 让 Agent 学习风格 → 生成候选 → 合成最优版本
① 学习
人定方向,Agent 建立知识基础。
② 执行
批量生成 · 筛选 · 合成最优引言。
③ 指导
AI 变成导师:解释“为什么这么写”。
最终成果:没有社会学训练的学生,也能理解“这个引言好在哪”。
| 维度 | 加速 | 赋能 |
|---|---|---|
| 使用人 | 导师(expert) | 学生(novice) |
| Agent 角色 | 干活的学生 | 干活的导师 |
| 核心机制 | 委托重复劳动 | 学习,执行,指导 |
| 人的贡献 | 方向把控 + 质量把控 | 方向把控 |
| Agent 的贡献 | 木牛流马 | 神来之笔 |
| 最理想产出 | 三天完成论文 | ASR 的引言 |
导师省时间,学生学知识。
或许未来,导师和学生的社会角色都将弱化。
| 能力区域 | 表现 | 具体任务 |
|---|---|---|
| 计算与代码 | ★★★★★ | 文件归纳、数据清洗、变量构建、回归实现、结果复现、图表生成 |
| 结构化知识 | ★★★★★ | 文献初筛、资料整理、编码本生成、摘要、发现、方法节与附录初稿 |
| 研究设计与框架搭建 | ★★★★★ | 可协助细化研究问题、提出论文结构与识别策略,但仍需研究者把关 |
| 理论提炼与学术贡献 | ★★★★★ | 可辅助总结潜在贡献、比较定位与发现逻辑漏洞,但不能替代领域专家判断 |
| 调查、访谈与田野 | ★★★★★ | 科研人员到现场,提供情绪价值 |
让智能体持续完善你的知识库,越用越聪明。
详见:karpathy/llm-wiki
核心
① 社会互动
政治资本 + 社会资本
核心
② 数据资料
物质资本
必须有
③ 学科前沿
文化资本
必须有
④ 驾驭智能体
使用思路
历史的镜子
从“汽车产业”到“汽车社会”:城市空间、婚姻家庭、汽车文化、地缘政治等。(吕鹏,2026年6月8日)

具身手艺与现场依赖是新时代的重要技能。(上科大 CEISD 等,2026年7月21日)
手写
提笔忘字
→
打字
键盘 / 拼音
→
语音
语音输入
→
脑机接口
读取脑信号
同一件事,四种输入方式。
这些技能,正在被淘汰吗?
国际象棋引擎早已远超人类(1997 年深蓝;2017 年后 AlphaZero、Stockfish 全面碾压)。可 2020 年以来,人类棋赛的观众与棋手数量反而暴涨。
机器明明更强,我们为什么还要看人下棋?
我们看的是“不确定”
体育与竞技的魅力,在于结果未知。一场注定“完美取胜”的比赛,没有人想看。
我们认同的是“会输的人”
人会失误、会紧张、会勇敢。机器没有“会输”的可能,也就无从认同。
体育、艺术、竞技,是我们观看“人在压力下如何成为人”的舞台。
难度与失误不是缺陷,而是人性显形的方式。
| 技能变化 | 人的变化 | AI 时代的含义 | 例子 |
|---|---|---|---|
| 弱化 | 退出日常使用,或作为特长 | 基本被 AI 取代 | 珠心算、计算尺、硬笔书法、荒野求生 |
| 共存 | 长期并存,各司其职 | AI 创造新的形式,真人仍有价值 | 田径、舞蹈、演唱会、包饺子 |
| 提升(加速 / 赋能) | 高手变快,新手变强 | 门槛骤降、操作外包,人类驾驭大方向 | 翻译、围棋、摄影、设计、写代码、做研究 |
| 新生 | 新技术催生新需求 | AI 创造新的工作和职业 | 司机、打字员、AI 训练 |
1956 年,黑龙江。你在生产队割麦子,一把镰刀,每天割一亩多地。
这天,邻村的国营农场开来一台机器,苏联援建的“斯大林-6”型联合收割机,轰鸣着推过麦地,一天轻松收割四百亩。
村里人围着看了半天。
有人说:“这玩意儿太贵,咱用不起。”
有人说:“机器哪有手稳,割坏了谁负责?”
也有人只是沉默,攥紧了手里的镰刀。
收割机 = AI 智能体 镰刀 = 传统方法 粮食 = 你的研究
① “我不需要收割机”
觉得 AI 影响不到自己的领域。
但每个学科都有体力劳动。
② “收割机太贵了”
镰刀便宜,够用就行。
但时间成本才是最大的成本。
③ “我学不会收割机”
对新技术的畏难情绪,宁愿用镰刀。
但学习曲线在快速变平。
④ “割坏了谁负责”
AI 用错了会制造错误:幻觉、数据泄露、逻辑漏洞。
合理警惕,但解法是学会驾驶,不是砸掉机器。
⑤ “地主用上收割机,我们没活路了”
担心 AI 加剧不平等。
合理关切,但不用 ≠ 不受影响。
有了收割机不等于丰收:
①
你得先有田
首先要有研究课题和数据。
②
你得知道四季节律
研究判断力不可外包。
何时探索、何时收敛,需要你来决定。
③
每家人的田都不一样
你的数据、方法、写作风格都是独特的。
需要根据自己的研究定制 Agent 配置。

来源:Tie et al. 工作论文 · arXiv:2605.23204
第一层:系统配置
安装工具,准备环境。
一次性工作。约 20 分钟。
第二层:任务配置
告诉 Agent 如何思考你的研究:
一次性投资,每个项目受益。
核心原则:
任何重复性任务,只需要解释一次。
任何相似的配置,只需要设计一次。
例子 1
一旦配置好“如何处理 CFPS 调查数据”,每个新项目都自动继承这套知识。
例子 2
一旦写好“文献回顾的框架参考 [某篇论文]”,Agent 在每次分析中都会遵循这个规范。
第一个项目最难配置,之后每个项目都更轻松。
这是复利,不是线性积累。
一个 CLAUDE.md 配置文件的核心内容:
当 AI 做得不令人满意,往往意味着:任务太大了,需要拆分。
路有弯道,直线冲刺只会翻车。
工具越强,越要守住研究者的判断:
数据源头的污染
Nature 报道(2026):
个人更强,集体更窄
Nature 研究还发现:
避免“直线冲刺”:选好目的地,打开导航,安全驾驶。
Hao et al. (2026). Nature. · Adam, D. (2026, June 2). Nature.
Agent 只能读写文本,文件格式决定了兼容性。
天然适配 ✓
Agent 直接读写,无需转换:
.do / .R / .py –分析脚本.md / .qmd / .tex –写作和幻灯片.csv / .json –数据.bib –文献需要桥接 ⚠
其它格式,Agent 需要桥接、解析或转换后处理:
.docx.pptx.xlsx.dta / .rds 等结构化数据原始 Word → Markdown → Agent 编辑 → Markdown → Word,但环不闭合。
✓ 保留
正文内容、标题层级、表格、引用、列表
✗ 丢失
修订模式、批注、自定义样式、字体、页眉页脚
原则: 在纯文本中工作,最后一步才转换格式。 接受格式漂移,把心思留给内容。
.docx 是 XML 的 ZIP,用 docx skill 直接改 XML,环闭合。
| 项目 | Markdown 路线 | XML 路线 |
|---|---|---|
| 内容(正文、表格、标题、引用) | ✗ 丢失 | ✓ 保留 |
| 格式(样式、字体、页眉页脚) | ✗ 丢失 | ✓ 保留 |
| 修订模式与批注 | ✗ 丢失 | ✓ 保留 |
| 维度 | QoderWork | ZCode | Kimi Code | Codex |
|---|---|---|---|---|
| 提供商 | 阿里巴巴 | Z.ai(智谱) | Moonshot | OpenAI |
| 核心模型 | 内置多家 | GLM-5.2 | K2.7 Code(256K 上下文) | GPT / Codex |
| 界面 | 桌面应用 | 桌面代理式开发环境 | 终端 CLI + IDE | 终端 + 手机 |
| 网络 | 国内直连 | 国内直连 | 国内直连 | 需稳定外网 |
| 最强项 | Office 文件、免编程 | 项目式代理开发 | 大代码库、长上下文 | 全平台、手机、免费层 |
四款工具的操作逻辑完全一样: 用自然语言提问,换工具不影响你已学到的技能。前三款国内直连,Codex 需外网。
同一内核,两种形态。都能跑代码、处理本地文件、联网搜索、执行多步骤任务。
Code 类 · 编程深度
Work 类 · 办公自动化
写代码、做研究 用 Code;处理文档、出报表 用 Work。
回答前两个必选问题,实时得到适合你的工具推荐与备选。
The AI is fast. You are the one who knows what matters.
谢谢!
沈明宏
ms14464@nyu.edu
课件资料:
https://www.socimh.com/slides.html
上机资料:
socimh.com/cc-guide/
知识截止日期
它接触不到最新最前沿的知识:刚发表的论文、最新动态,Agent 可能不知道。
应对: 你来提供最新文献,Agent 来整合。
上下文窗口限制
上下文有限,没办法处理非常宏观的知识结构,也难以一次性处理超大型数据集。
应对: 分块处理,模块化配置。
Agent 不是专业素养的替代品。 它是你的执行层,你仍然是研究的主人。
张雪峰的认知操作系统
五大心智模型
数据基础
取决于:
1. 这个职业里,有多少工作可以被 AI 加速或赋能?
2. 这个职业的业务范围可以拓展吗?还是只能内卷?
3. 这个职业的从业门槛怎么样?
①
没有稳定可用的境外网络
需要线路稳定、干净、用的人少,且支持终端代理模式(TUN 模式)。追求稳定,推荐配置静态 IP。
②
没有可用的境外支付渠道
订阅需要境外银行卡,或通过 App Store(外区)、Google Play 等渠道付费(有溢价)。
③
没有可用的境外账号
部分境外服务(OpenAI / Anthropic 等)需要境外手机号,乃至于国外的护照/身份证 + 人脸认证。
淘宝和第三方平台有大量中转站提供账号和订阅服务,但价格和安全性参差不齐,需谨慎选择。
Nature 计量研究:用 ML 分类器扫 4100 万+ 篇论文(1980–2025,六大学科),筛出 31 万篇明显使用 AI 的论文——一笔双面账:
个人层面的账:赢
集体层面的账:输
“我们像群居动物。”(Evans)——会用 AI 是个人的护城河;但所有人都爬同一座山,大片领域就无人探索。
Evans & Xu 团队(Nature)· Science News 报道:Zhao, C. (2026-01-22). Science 391(6783). DOI: 10.1126/science.aef6710
大规模实证给出了相同方向的答案
个人层面 · 谁用谁领先
用 AI 的研究者
同一研究也发现集体话题多样性下降 4.6%
谁受益最大 · 新手
生成式 AI 辅助知识工作
越不熟练,增益越大,正是“赋能”的硬证据
Hao et al. (2026). Nature. · Brynjolfsson, Li & Raymond (2025). Quarterly Journal of Economics.
Minghong Shen · 2026 · SHU Summer School