把微信图片、文档、语音、视频里的文字识别成笔记
把微信图片、文档、语音、视频里的文字识别成笔记
平时在微信里看到一张满是字的截图、一段几分钟的语音、一个会议录像,里面的内容想留下来翻——既不想自己一句一句敲,又不想只存个文件链接放着积灰。这一篇教你怎么把内容交给 DeepSeek、豆包、千问 等 AI 处理,让里面的字、说话内容自动变成笔记里可搜可复制的文字。
这个功能目前对应的是 Obsidian 用户(微信”Obsidian”好友这条线)。其它笔记软件用户可以先用合并转发把内容存下来,文字识别能力之后会陆续接入。
一、它能干什么
把以下三类内容通过微信发给”Obsidian”好友,触发后 AI 会自动整理里面的文字:
| 你发的内容 | 整理出来的东西 | 落到笔记里的位置 |
|---|---|---|
| 图片(截图、文档照片、PPT 拍照、海报…) | 图里的所有文字 | 和图片一起落在同一天的消息笔记里,紧跟在图片后面 |
| 语音(自己录的、群里转过来的、会议片段) | 说话内容的转写 | 单独成一篇笔记 |
| 视频(短视频、会议录像、课程剪辑) | 视频里说话的转写 | 单独成一篇笔记 |
直接发和用”文件”方式发过来都行——直接发的图片/语音/视频会走同一条识别管线;用”+ → 文件”以附件方式发过来的常见图片、视频、录音文件(mp4 / mp3 / m4a / wav 等,完整列表见末尾)也会被一并识别。
视频识别的是说话内容(人声、旁白、对白),而不是画面里的字幕或屏幕里出现的文字。
二、怎么用
发过去就自动识别,不用写备注(2026-07-04 起默认开启):
- 语音 / 视频 / 录音文件:发过去就转写。
- 图片:默认也识别,但系统会先判断这张图是不是「文字图」(截图、文档照片、思维导图、聊天记录长图……);判断成普通照片就只保存图片、不出文字。想确保一定识别,备注里写一个「转」字——不经过判断直接识别,图片还会额外做一遍版式还原的文档式整理。
- 不想识别:备注写「不转」「不要转」或「跳过」,本条只存文件。
💡 这个默认行为对应用户设置页里的「发给助手的图片/音视频是否自动转录为文本」开关,默认开启;关掉之后就回到「必须在备注里写暗号才识别」的老规则。
🔗 设置页入口:打开 https://my.bijitongbu.site/settings 就能找到上图里的这些开关。
第一步:转发给微信“Obsidian”好友
在微信里长按要保存的图片 / 语音 / 视频 → 转发 → 选择微信“Obsidian”好友。
还没添加“Obsidian”好友的,先看 《同步不成功排查》 末尾的添加流程。
第二步(可选):用备注控制识别
转发到企业微信好友时,会出现”留言”或者”备注”输入框。默认什么都不用写;想强制识别(尤其是图片)就在那里输入下面任意一个词:
- 转
- 转录
- 识别
- 文字
举几个例子:
- 备注
转—— ✅ 强制识别(图片会额外做版式还原) - 备注
转录一下—— ✅ 触发(包含「转」和「转录」) - 备注
帮我识别下文字—— ✅ 触发(包含「识别」和「文字」) - 备注
记一下—— 不含关键词,按默认规则处理(语音 / 视频照常转写;图片先判断是不是文字图) - 完全不写备注 —— 同上,按默认规则处理
- 备注
不转/不要转/跳过—— ❌ 本条不识别,只存文件
关键词只要在备注里出现就行,不需要单独成句。「整理」「帮我看看」这类词不算关键词,等于没写备注(走默认规则)。
实际操作的样子(视频转发到微信“Obsidian”好友时,在备注栏写一个「转」就行):
第三步:等通知
发出去之后,会收到微信通知:
- 图片:通常 3~5 分钟内整理完成。下次打开 Obsidian 同步一下,图和识别出的文字会一起出现;如果图被判断成普通照片,就只有图、没有文字——备注「转」重发一次即可
- 语音 / 视频:内容长的话需要更久(几分钟到 30 分钟左右),后台慢慢处理;处理好之后会单独多出一篇标题以「[转录]」开头的笔记
三、发文档(Word / PDF / PPT / Excel)会自动多出一篇正文笔记
除了图片、语音、视频,发一个文档过来,助手还会自动帮你多整理出一篇”正文笔记”——文字可搜、可复制、还能在笔记里直接改,不用再点开原文件慢慢翻。开关就是上面那张设置图里最下面一行——「文档转 Markdown(默认开)」,默认开着,把文档发过来就会多一篇笔记。
📄 这部分内容已单独成篇详解(怎么用、支持哪些文档、计费,以及发一个文档为什么会陆续收到 4 条微信通知):发文档自动多整理一篇正文笔记。
四、收到的微信语音消息怎么存?
聊天里别人发来的那种灰色语音条,没法像图片 / 视频一样”长按转发 + 备注「转」“。用一个绕过去的小办法就行:
- 在微信里长按这条语音 → 点「转文字」(微信自带功能),等几秒,气泡下面会出现一段转写文字
- 截图这段带转写文字的对话画面
- 把这张截图转发给微信”Obsidian”好友,备注里写一句「转」
这样就走图片识别这一条线——截图里的文字(也就是语音内容)会和截图一起进笔记,下次直接搜文字就能找回这条语音说了什么。
这种方式适合别人发来的、不长的语音消息。如果是自己录的长语音、或者拿到的是
.mp3/.m4a/.wav这种音频文件,直接用「+ → 文件」发过来 + 备注「转录」就行——走的是音频转写线,效果比截图 OCR 更准。
五、效果是什么样
图片:图下面附一段识别文字
发一张满是字的截图,备注 转。最后笔记里看到的就是:
(笔记里)
[原图片]
---
**识别文字:**
完整的图里文字内容……
图还是原来那张图,下面多出图里所有的文字——下次想找这段内容时直接搜文字就能搜到,不用再开图找。
语音:单独成一篇笔记
发一段 5 分钟的微信语音,备注 转录。
会多出一篇笔记,标题类似 [转录] 同步助手_20260430_xxx_语音,正文就是这段语音的完整转写。
视频:单独成一篇笔记
发一段会议录像,备注 识别。
会多出一篇笔记,标题类似 [转录] 同步助手_20260430_xxx_视频,正文是视频里说话部分的完整文字稿。原视频文件链接会保留在最初那篇笔记里,不会丢。
六、几个常见的小坑
1. “转账”也会触发
因为关键词是 转 / 转录 / 识别 / 文字,所以”转账记录”、“识别证件”、“文字介绍”这种词里包含的”转”或”识别”也会被算成识别请求。
如果你只是想存个文件、不要识别,备注里写「不转」或「跳过」。
2. 视频很长可能要等比较久
特别长的视频(比如一小时课程)后台需要十几到三十分钟处理,这期间微信里不会一直转圈——你可以先去做别的事,处理完之后会一次性把转写结果同步出来。
3. 整理出来是空的
可能的原因:
- 图片里其实没有文字(纯画面 / 纯插图)—— 正常,不会强行编内容
- 图片被系统判断成普通照片(文字很少、大面积配图)—— 备注「转」重发一次,跳过判断直接识别
- 语音 / 视频里没人说话,或者全是音乐 —— 转写结果会很短或为空
- 视频是屏幕录像那种”画面里有字、没人说话” —— 当前识别的是声音,没有声音时识别不到
4. 图片太大可能不出文字
为了不让一张大图把后台占用太久,单张图片大于 10MB 时会跳过文字识别(图本身仍然完整保存到笔记,只是不再附识别文字)。如果你发的是高清扫描件或者高分辨率截图,可以先在手机里压缩一下再发过来。
这个上限只影响图片识别。语音和视频后台是异步处理,不受这个限制。
5. 我的备注写对了但没触发
按这个顺序排查:
- 转发对象确认是微信“Obsidian”好友(不是公众号、不是其它助手好友)
- 没写备注的图片会先过「是不是文字图」的判断;想强制识别就在备注里写上 转 / 转录 / 识别 / 文字 中的某一个
- 内容是图片、语音、视频,或者文件后缀在末尾”支持的文件格式”列表里;纯文字 / 链接 / 不在列表里的文件类型不走这条路径
- 都对了还是没反应 —— 直接联系客服看是哪一步卡住了
6. 视频识别只出了开头几句、后面没了
少见但确实会遇到,常见原因:
- 积分中途扣到 0:超长视频处理过程中积分耗尽,剩下的部分会被跳过。先在服务号发”积分”看下余额;如果是 0 或负数,充值后把链接重发一次即可。
- 视频里中间有大段无声 / 纯背景音乐:当前识别的是说话内容,遇到没人说话的段落会跳过;不是 bug,把鼠标拖到有人说话的位置看下视频本身有没有声音即可。
- 链接本身只能拿到预览片段:有些平台分享出来的链接对方未登录就只能看前几十秒,能识别的也就那么多内容。换条完整视频的链接再发一次。
如果上面都不是,直接把链接和发送时间发给客服,从后台能看到具体在哪一步停的。
7. 文件在微信里还没下载到本地就直接转发
用「+ → 文件」发文件给助手时,首次接收方必须先点开文件下载到本地——文件下方只要还显示灰色「未下载」三个字,或者你转发的是整段聊天记录里夹着未下载的文件,助手都没法替您下载和同步,会回推一条「工单完成通知 / 处理结果:获取失败」的提醒:
收到这条提醒就回到原来的对话先点开文件下载,再单独转发一次给助手即可。另外还有单文件大小上限:用「+ → 文件」发的文件(Word / PDF / PPT / Excel / 录音 / 视频 / 图片附件等)单文件最大 300MB,超过这个大小助手不会处理;要整理成正文笔记的文档另有一道 200MB 上限(200~300MB 只存附件不整理正文);OneNote 通道仍是 100MB。
8. 不支持的几种情况
- 批量识别一次性几十张图:目前不支持批量打包识别,需要一张一张发(或一段段地发),每条带”转”或”识别”备注。
- 识别错别字 / 识别结果不对:当前没有”再识别一次”或”在线修订”的入口,直接在笔记里修改就行。AI 模型升级后会逐步变准。
- 拍照写的字(潦草手写):识别支持手写体,但字迹潦草、灯光不均、纸面反光都会影响准确度。先用一张照片试试效果再决定要不要批量发。
- 打印体扫描件:效果最好,绝大多数情况下错字率很低。
- 屏幕截图:效果跟”打印体扫描件”接近。
七、计费说明
图片文字识别、录音 / 视频文件转写、微信语音条转写,全部免费、不消耗积分(2026-08-20 起;此前按识别字数每 1000 字 1 积分)。识别失败或没识别到内容自然也不扣。
笔记底部会有一行小字标明「识别 N 字 · 本次未扣积分」,方便你确认。
注意区分:视频链接(把平台上的视频链接发给助手做图文笔记)是另一条线,按时长 5 积分/分钟、单条最多 15 积分,见《视频转图文笔记教程》。
积分余额、充值入口在「笔记同步助手」服务号底部菜单 高级权益 → 积分;流水明细在隔壁 查积分明细。完整积分体系参见 《笔记同步助手积分用途说明》。
八、卡住了怎么办
发过去半天没反应、识别出来明显错了、笔记里压根没出现新内容,可以直接联系客服:
把发送时间和大致内容告诉客服,从后台能看出是哪一步卡住的。
九、相关阅读
十、支持的文件格式
直接发图片 / 语音 / 视频不用管格式——微信本来发什么后台就吃什么。
如果是用「+ → 文件」以附件方式发过来的,下面这些后缀会被识别成对应内容(不区分大小写):
📦 用「+ → 文件」发过来的单文件最大 300MB——一两个小时的会议录音、几百兆的会议录像都可以直接发过来,不用先剪短或压缩。要整理成正文笔记的文档另有一道 200MB 上限;OneNote 通道仍是单文件 100MB。
超过 100MB 的视频请用「+ → 文件」发原文件:微信聊天里直接转发的视频会被微信压缩,走的也是另一条上限更小的通道(100MB)。
图片(识别图里的文字)
.jpg · .jpeg · .png · .gif · .bmp · .webp · .tiff · .tif · .heic · .heif · .avif
录音 / 音频(转写说话内容)
.mp3 · .m4a · .wav · .wave · .aac · .flac · .ogg · .oga · .opus · .amr · .3ga · .aiff · .aif · .caf · .wma · .ape · .mka · .weba
几乎覆盖所有手机录音 App 的导出格式:iPhone 语音备忘录(
.m4a/.caf)、安卓 / 三星老语音(.amr/.3ga)、播客 / 音乐(.mp3/.flac/.ogg)、Windows 录音(.wma)等。
录音文件出来的是一篇完整笔记,不是一段光秃秃的转写
发进来的录音 / 视频文件会走完整的整理流程,笔记从上到下是:
- 📎 原文件下载链接(永远在最上面,随时能把原始录音下回来)
- 一句话总结 + 关键观点(3–8 条)+ 全文纪要(按主题分小节)
- 逐字稿——已经过 AI 校对(补标点、修正明显错别字),多人对话会自动标出 「【说话人1】/【说话人2】」,谁说的一目了然
- 底部一行小字:识别了多少字、本次未扣积分(识别免费)
逐字稿有两种形态,在设置页「逐字稿模式」里切换:全文整理(默认,改写成书面语、 按发言人分段)和 口播逐字稿(保留原话 + 每句时间戳)。两种都带说话人标记。
视频(转写视频里说话内容)
.mp4 · .mov · .m4v · .avi · .mkv · .flv · .wmv · .webm · .3gp · .3g2 · .mpg · .mpeg · .mts · .m2ts · .ts · .ogv
以上三张表针对的是图片 / 语音 / 视频这条线。Word / PPT / Excel / PDF 等文档不在这三张表里——它们走的是另一条「文档自动整理成笔记」的线(见上面第三节),默认开启、不用写关键词就会帮你多整理一篇正文。压缩包(.zip 等)和极少见的容器格式仍只作普通文件保存,留一条下载链接。