关于未来交互方式的思考
人不再需要学习软件怎么使用,软件开始学习人究竟想干什么。
现在 OpenAI 的 Realtime 已经把实时 speech-to-speech、文本、图片、音频放进同一套实时交互体系;Google Project Astra 也在往“AI 看见你的摄像头、屏幕并与你实时对话”发展。
- 我认为未来真正的交互终局不是 Voice,而是 Intent
可以把计算机交互史压缩成四步:
CLI 时代
我要学习机器怎么说话。
mkdir
cd
grep
git commit
↓
GUI 时代
我要学习软件在哪里。
打开 Photoshop → 找图层 → 找蒙版 → 找工具 → 调参数。
↓
自然语言时代
我告诉机器我要什么。
“帮我把这个背景换成黑色。”
↓
AI Native 时代
我表达意图,AI 自己理解上下文并完成目标。
我:
这个不太对
字体再克制一点
这里有点太挤
整体更像 Apple 一点
AI:
理解当前作品
理解“这个”指什么
理解你的审美历史
修改
展示结果
等待反馈
这里真正消失的是:
Command → UI → 操作步骤。
留下的是:
Intent → Result → Feedback。
所以我甚至会把未来 HCI 的核心公式写成:
Human Intent → AI Interpretation → Action → Visible Result → Human Correction
- 那么比“说话”还原始的交互是什么?
答案其实特别有意思。
我认为有六种极其原始的人类交互。
第一种:指
这是我认为未来非常重要、甚至可能被低估的交互。
人类最自然的一句话其实是:
“这个。”
而不是:
“请把屏幕左上方距离左边大约 120 像素、距离顶部大约 80 像素的蓝色按钮……”
所以:
Pointing + AI
可能比 Prompt 更重要。
例如设计:
你直接点一下某个组件:
“这个再大一点。”
圈住一个区域:
“这里太乱了。”
拖一个东西:
“我想要这种感觉。”
Apple 的 HIG 长期强调 direct manipulation + immediate feedback,也就是直接操作对象并立即看到结果。
而 AI 让 direct manipulation 进一步变成:
Direct Manipulation → Direct Intention。
过去:
拖动一个元素。
未来:
指着元素说:“这个不好。”
AI 自己判断:
是尺寸?
层级?
对比度?
spacing?
typography?
信息密度?
3. 第二个比语言更强的东西:做给 AI 看
这个我认为会非常重要。
叫:
Demonstration
不是:
Tell AI what to do.
而是:
Show AI how you do it.
例如一个销售每天:
打开 CRM
↓
看客户信息
↓
打开企查查
↓
复制公司信息
↓
打开飞书
↓
查询历史聊天
↓
生成拜访纪要
↓
更新 CRM
你根本不需要写:
“请帮我创建一个 Agent,步骤如下……”
AI 看你操作两三遍:
“我知道你每天在干什么了。”
然后问:
要不要以后我帮你做?
这就是:
Learning by Demonstration。
它对你研究的 FDE / 企业 AI 提效尤其重要。
因为企业里面大量 Know-how 根本没有 SOP。
员工自己都说不清楚。
你问:
“你的业务流程是什么?”
他说不明白。
但你说:
“你今天正常工作,我看着。”
大量 tacit knowledge 就暴露出来了。
所以未来企业 AI 一个非常重要的交互可能不是:
Prompt Engineering
而是:
Demonstration Engineering
让员工:
做给 Agent 看。
- 第三个:Show——“你自己看”
这是 GPT Live / Astra 这类产品真正让我觉得重要的地方。
未来一句非常高频的话可能是:
“你看一下。”
然后:
摄像头看到现实世界。
AI:
知道你在看什么。
或者:
共享屏幕。
你:
“这里为什么不对?”
AI 不需要你:
复制错误日志 → 打开 ChatGPT → 粘贴 → 描述上下文。
Google 在 Project Astra 展示的方向就是让 AI 通过摄像头、屏幕共享理解用户正在看到的环境。
这意味着:
以前是:
我 → 把 Context 搬给 AI。
未来是:
AI → 直接处在 Context 里面。
这是极大的变化。
- 第四个:画
语言有一个巨大缺陷:
很难表达空间关系。
比如你跟 AI 说:
“我希望左边是导航,中间主体内容稍微往右一点,然后右边这里浮一个 AI Panel……”
讲一分钟可能还讲不清楚。
但是你:
┌───────────────┐
│ NAV │ │
│ │ CONTENT │ AI
│ │ │ PANEL
└───────────────┘
10 秒。
AI:
明白。
所以 Sketch 本质是一种:
高信息密度 Prompt。
尤其是:
UI
建筑
工业设计
流程
组织结构
数据分析
空间规划
都会大量使用:
Sketch + Voice + AI。
- 第五个:拖
Lovart 我认为真正值得研究的不是它用了什么模型。
而是:
Canvas 本身就是 Prompt。
Lovart 官方现在强调 infinite canvas,并且允许用户直接选中元素,再通过工具或自然语言继续修改。
这个交互范式很重要。
因为过去:
Prompt
↓
Generate
↓
Download
↓
重新 Prompt
↓
Generate
作品和 AI 是分离的。
Lovart:
AI
↓
idea → Canvas ← 用户
↑
直接修改
Artifact 本身成为 Conversation。
你不是在:
和 Chatbot 对话。
你是在:
和 AI 一起面对同一个东西。
2026 年一项关于 AI + infinite canvas 的研究也观察到了类似变化:设计师的工作逐渐形成 generate → curate → refine 循环,AI 更多承担生成与组织,人把精力转向选择、关系组织和判断。
这个范式未来很可能从设计扩散到:
Figma
→ AI Canvas
Excel
→ AI Data Canvas
Notion
→ AI Knowledge Canvas
IDE
→ AI Coding Canvas
CRM
→ AI Customer Canvas
ERP
→ AI Business Canvas
7. 第六个,我认为甚至比前五个更终极:AI 自己看懂
这一步是:
Zero-input Interaction
今天:
用户主动告诉 AI。
未来:
AI 已经知道发生了什么。
比如你打开电脑。
AI 知道:
今天 10:00 有客户会议
昨天你答应客户:
给一个 AI 客服 Demo
GitHub 当前版本:
Demo 80% 完成
客户刚发来:
3 个新的需求
距离会议:
37 分钟
AI 不需要等你问:
“我现在应该做什么?”
它直接把 Workspace 准备好:
乌苏里江药业 / Meeting Mode
客户新增需求 Demo 当前状态
- 私有化部署 ✓
- 飞书接入 ✓
- 药品知识库 ⚠️
建议本次会议:
不要承诺自动诊疗能力
重点 Demo:
知识库 + 内部问答 + 销售助手
[开始演示]
但这里必须保留非常重要的一层:
Human Approval
AI:
“我准备好了,要执行吗?”
你:
“执行。”
所以我会把未来交互归纳成 7 个最原始的动词
人类行为 AI Native 交互
说 Speak 描述目标
指 Point 指定对象
看 Look 表达注意力
画 Draw 表达结构
做 Do 示范流程
给 Show 提供上下文
确认 Approve 决策与控制
你会发现:
这里几乎没有 Button、Menu、Form、Settings。
这非常关键。
因为这些东西本质上不是人的自然行为。
是过去因为:
计算机不理解人。
所以我们被迫发明的一套中间语言。
因此我对未来 AI 产品有一个非常强的判断
不是:
Voice First。
而是:
Context First + Multimodal + Direct Manipulation + Agent
最自然的交互可能是:
“看着我正在看的东西,听我说,理解我指的东西,然后替我做。”
即:
看
↑
说 ← Human → 指
↓
做
│
▼
AI
│
理解 Context
│
▼
执行 Action
│
▼
Shared Workspace
│
▼
用户修正
这可能比纯 Voice 更接近终局。