长按,直接说
长按输入框开始录音,松手结束;上滑后松手取消,沿用熟悉的语音手势。
对话示意
帮我整理一下这个页面的信息。
可以结合当前屏幕来处理。告诉我你想保留哪些内容。
让零散的想法,变成有上下文的对话和看得见的操作。
长按输入框开始录音,松手结束;上滑后松手取消,沿用熟悉的语音手势。
独立的对话 Agent 管理上下文,需要操作手机时交给 Midscene 执行。
发送照片、拍摄图片或添加文件,让助手了解你正在处理的内容。
打开执行报告,查看操作过程、截图和失败原因,方便核对结果。
填写兼容的模型 API。语音识别单独配置,支持火山引擎和 Deepgram。
操作手机需要开启无障碍服务;录音、屏幕采集等权限按使用场景申请。
在聊天页或全局助手面板提出任务,随时查看对话和执行报告。
可选的语音润色使用独立模型,整理口癖、重复和段落。润色失败时保留识别原文。
使用自己的 API。密钥通过 Android Keystore 加密保存。模型、语音识别和可选的润色请求会发往你配置的服务商;报告保存在应用私有目录,分享时才由你导出。
隐私与权限 →目前为测试版,不同应用的兼容性存在差异。需自行配置 API,服务商可能收取费用。