久操免费资源,久久伦理一区,国产又黄又爽视频,情草av网,日本久久久在线免费,精品人妻互换一区三区,熟妇女一区二区三区,亚洲AV三区视频免费,老司机在线精品

AI終將擺脫屏幕進入日常生活,本文分析了當下AI語音交互的主流硬件入口與現存挑戰(zhàn),探討AI自然交互的發(fā)展方向。 ## 1. 語音成為AI時代更適配的自然交互方式 相比PC時代的手動打字輸入需要預先組織邏輯,語音輸入允許邊輸出邊思考修正,無需穩(wěn)定桌面環(huán)境與專業(yè)文字能力,更接近人類思維的原生模式,催生了一批圍繞語音入口的AI產品。 ## 2. 當前主流AI語音入口的三類方案與各自痛點 - **TWS耳機組合方案:評價標準轉向人聲分離能力** 一副成熟TWS耳機搭配手機AI就能組成低成本24小時AI副手,性能優(yōu)于多數專用AI硬件,但核心瓶頸是麥克風的環(huán)境人聲處理。過去耳機比拼音質、延遲、降噪,未來需額外比拼人聲降噪的強度與準確率,耳機麥克風已從通話配件升級為前端AI控制器。 - **智能眼鏡方案:受隱私與綁定限制難成主流** 智能眼鏡主打“所見即所問”的AI交互,但帶拍攝收音功能的產品會帶來社交壓力,硬件性能不如成熟TWS,且多深度綁定品牌端AI,限制了用戶對模型的選擇權,難以成為主流。 - **獨立語音硬件:語音輸入獲得穩(wěn)定物理入口** 2026年興起獨立AI語音入口方案,OpenAI的Codex Micro專門設置了PTT按鍵,象征語音輸入已成為高頻交互方式,更有無屏便攜語音設備的規(guī)劃方向。此外學界已有無聲語音交互的探索,通過識別舌部運動、面部肌肉活動解碼指令,距離消費級應用仍有距離。 ## 3. AI語音交互的核心待解難題:平衡成本與體驗 語音交互更符合人類溝通習慣,但token消耗遠高于純文本輸入:原生多模態(tài)語音處理的token消耗量通常是純文本的10倍以上,自然度越高計算越復雜,用戶消費成本也越高。未來AI廠商的核心競爭點,是以更低延遲、更少冗算、更透明計費,調和不同模態(tài)的成本差異,讓用戶愿意持續(xù)使用語音交互。
全世界都在講AI 話
2026-07-21 12:10

全世界都在講AI 話

本文來自微信公眾號: 愛范兒 ,作者:發(fā)現明日產品的,編輯:肖欽鵬,原文標題:《全世界都在講 AI 話|AI 器物志》


智能手機統(tǒng)治了過去十幾年的數字生態(tài),它是注意力的黑洞,是我們最私密的隨身之物。但手機從設計之初就是為「人盯著它」而生的——它的全部邏輯,都止于屏幕。


AI的需求卻恰恰相反:它需要持續(xù)感知物理世界——見你所見,聽你所聞,隨時在場,而非等你解鎖屏幕才醒來。


當AI真正成為一種基礎能力,它遲早要從屏幕里破殼而出,尋找屬于它自己的形狀。這將是一個漫長的探索和演化過程。


「AI器物志」欄目由此而來,愛范兒想和你一起持續(xù)觀察:AI如何改變硬件設計,如何重塑人機交互,以及更重要的——AI將以怎樣的形態(tài)進入我們的日常生活?


這是「AI器物志」的第19篇文章。


過去兩年里,AI最明顯的變化不只是模型變聰明,而是它的定位從少數人的專業(yè)工具,轉變成了日常生活的基礎能力。


如今,我們更是習慣了在走路、開車、做飯甚至摸魚期間,隨時隨地向AI發(fā)出指令。


圖|Google


只不過隨著頻率提高,以PC時代鍵鼠交互為主的人機交互方式正在逐漸暴露出短板——


「手動打字」需要用戶先有一個想法,再將散亂的思緒組織成連貫語言,還要在敘述中保持一定的邏輯關系,才能將腦袋里想的變成AI能夠理解的提示。


而在鍵盤的另一邊,手機時代所主導的「語音輸入」就幾乎沒有這樣的桎梏。


畢竟講話和打字最大的區(qū)別,就是語音允許人們一邊輸出,一邊思考、補充和修正,相比鍵盤輸入更接近思維原本發(fā)生的方式。


此外,語音輸入不需要穩(wěn)定的桌面環(huán)境,也不要求用戶持續(xù)低頭,更不用優(yōu)秀的文字表達能力——


對于絕大多數沒有受過系統(tǒng)寫作訓練的普通人來說,語音遠比文字輸入更接近「真正的自然交互」。


這種廣泛的需求之下,自然也催生出了一批圍繞語音入口展開的產品。


比如勢頭正盛的Plaud,主打的就是將錄音、轉寫和總結包裝成完整工作流;


成為樣板產品的Typeless則負責刪除語氣詞、進行格式清洗后「幫你成文」。


諸如光帆Lightwear之類的可穿戴設備則更進一步,試圖整合出一條傳統(tǒng)智能手機之外,全場景的完整AI使用流。


圖|光帆科技


這些產品的形態(tài)各不相同,押注的卻是同一件事:


下一代AI入口,未必要求用戶坐下來、打開應用并認真打字。


嘿,AI


「自然語言交互」聽上去非常先進,但它先進的地方其實是溝通效率,技術原理上并沒有什么驚天地泣鬼神的地方。


門檻最低的方案,就是一副TWS耳機加手機上的AI,就能組成一個24小時在線的虛擬副手。


初代AirPods廣告《Bounce》|Apple


畢竟耳機本來就在耳朵里,手機系統(tǒng)與第三方app也有現成的語音轉寫、快捷指令和跨應用輸入。


不需要任何專用硬件,就可以把你散碎的命令傳達給任何一個AI模型。


更殘酷的是,它的速度、兼容性和跨設備能力,仍然優(yōu)于市面上大多數號稱「開創(chuàng)先河」的專用AI硬件——


圖|Mashable


然而現實情況是,這套近乎無門檻的組合,真正的瓶頸不在手機、而在麥克風對環(huán)境人聲的處理。


就拿AirPods為例,由于AirPods的麥克風策略強調聲音自然度、不愿意給人聲降噪,在多人環(huán)境里經常會出現將周圍說話的聲音一并采集到轉成文字的問題。


這對于打電話或者發(fā)語音沒什么,但對于AI輸入,一旦提示詞「夾生」,就很容易得到完全不相關的回答:



相比之下,國產品牌的TWS耳機普遍采用了更激進的人聲隔離策略,犧牲了一些通透模式自然度,換來了電話和AI語音期間更好的準確率。


如果往更深層看,這意味著在AI成為「主流使用場景」的當下,耳機好壞的評價標準正在改變——


過去耳機比的是音質、延遲和降噪,未來除了前面這些,更要比較人聲降噪的強度、準確性和分離能力。


甚至我們可以說,耳機麥克風正在從逐漸被人遺忘的通話配件,一舉變成了最前端的AI控制器。


語音指揮的第二條路線,則是智能眼鏡。


盡管智能眼鏡總是強調「給人生加上一塊HUD」,但從商品化結果來看,唯一成功的智能眼鏡仍是以語音、拍照和開放式音頻為核心的基礎款。


圖|Laptop Mag


這背后的原因倒不復雜:眼鏡顯示系統(tǒng)會犧牲重量、續(xù)航和成本,更需要從0培養(yǎng)一套全新的用戶使用習慣。


而「看見什么問什么,AI講給你聽」,本身就足夠構成一個相對清晰的AI賣點了。


圖|Meta


但智能眼鏡的問題在于,它的「無感」更多存在于宣傳片里。


畢竟當一副帶攝像頭的眼鏡持續(xù)朝向別人時,對方很難判斷設備是否正在拍攝或者收音,這種不確定性本身就會制造社交壓力。


再加上受限于體積和續(xù)航,智能眼鏡的麥克風陣列、通話降噪和揚聲器效果,不一定比成熟的TWS耳機更好。


更重要的是,在目前智能眼鏡的銷售模式中,這類產品往往與品牌客戶端和云端模型深度綁定,用戶在模型選擇、數據遷移和跨設備切換方面缺乏自由度。


最簡單的例子就是Meta。


Meta Ray-Ban智能眼鏡在各個方面都比較平衡,卻強制用戶連接Meta?AI,不能作為藍牙音頻設備直接喚醒Siri或者其他智能助手。


圖|Engadget


這種程度的綁定讓智能眼鏡雖然成為了「語音AI交互」的代表性產品,卻很難成為那個主流產品。


第三條路線,則是2026年以來逐漸興起的道路——為語音輸入AI制造獨立硬件入口。


比如剛剛OpenAI與Work Louder聯(lián)名的的Codex Micro,就是一塊面向AI智能體的外置控制臺。


并且上面專門設置了一個用于語音輸入的push-to-talk(PTT)按鍵:


圖|OpenAI


盡管Codex Micro本身沒有麥克風,PTT需要調用電腦連接的其他收音設備,但這種設計依然具有象征意義:


語音輸入已經不再只是UI中的一個小圖標,而開始逐漸獲得類似鼠標右鍵、手機拍照鍵或者鍵盤指紋一樣的穩(wěn)定的物理位置。


將語音輸入單獨作為一個按鍵設置,基本上承認了這種AI交互方式的高頻屬性——甚至對某些用戶可能比26個字母鍵都要更高頻。


而PTT/TNT更進一步的設想,就是徹底擺脫屏幕。


愛范兒之前爆料過,OpenAI正在規(guī)劃的若干硬件產品中,就包括一個無屏的便攜設備,通過語音、攝像頭和環(huán)境傳感器理解用戶所處的情境。


如果OpenAI真的這樣設計,無異于承認了曾經Humane AI Pin的道路。


當然,背后有ChatGPT和Codex做背書,OpenAI的徽章肯定會比Humane的更實用。


與此同時,面對AI語音交互最難繞開的兩個問題:公共場合說出個人安排的尷尬,以及嘈雜環(huán)境中的識別失真,研究者們也有了一些奇思妙想。


比如近期出現的一些「超聲波舌部動作識別」設備,通過抵在下頜的超聲波探頭讀取舌頭運動,再用機器學習將其解碼為語言:


圖|Hackaday


另一些研究則嘗試把傳感器裝進眼鏡或頭顯,通過面頰、顴骨和口部的細微運動識別無聲指令——之前被蘋果悄悄收購的Q.ai就是研究這個方向的。


關聯(lián)閱讀:蘋果史上第二大收購案,目標卻不是手機|硬哲學


這些裝置距離消費級產品仍然很遠,識別范圍、準確率和佩戴體驗也存在明顯限制,但方向已經足夠清晰。


未來的「語音輸入」未必真的需要發(fā)出聲音——所謂語音交互,最終可能演化為對人類發(fā)聲動作、口型乃至面部肌肉活動的直接識別。


幫我算算token用量


歸根結底,為什么語音輸入能夠在AI時代獲得超越鍵盤的聲望,還是因為人類不是純粹的「視覺動物」。


換言之,人們雖然習慣于用眼睛接收信息,但并不擅長用視覺信號發(fā)送信息。


在傳遞信息這件事上,我們仍然遵循著30萬年前的習慣:發(fā)出「咕咕嘎嘎」的聲音就是要比打手勢效率高。


用語音指揮AI,看似是一種相對低效的使用方式——人在講話時經常重復、跑題,表達也很難稱得上精煉。


但它最大的特點,就是消弭了AI的工具感。


無論用戶潛意識里把AI當作下屬、秘書還是同伴,以對話作為交流媒介,始終比填寫命令框更接近人類本源的協(xié)作方式:


然而「語音交互」雖然便利,這種便利的隱性成本也在上升。


傳統(tǒng)STT工具只負責把聲音轉換成文字,最終模型用來計費的只有轉換后的文本輸入與輸出token;


而Typeless之類的「文本清洗」工具還要額外調用模型,對口語進行整理和改寫,再把整理后的內容發(fā)送給另一個AI,中間又疊加了一層token消耗。


圖|MakeUseOf


而當各家的多模態(tài)模型進入「原生音頻」的階段之后,由于需要持續(xù)處理聲音、上下文、語氣、打斷和輸出,一個工作階段內的token消耗量往往是純文本的10倍或更高。


雖然與高清圖片和視頻處理相比,語音處理的總token成本依然不算離譜,但它已經不再是一個可以忽略的附屬功能。


尤其在長時間實時對話中,用戶很難像輸入文字那樣主動控制信息長度,模型卻必須持續(xù)維持連接、理解上下文并生成反饋。


圖|Mashable


這就導致AI語音交互越自然,背后的計算過程反而越復雜,用戶最終的消費成本也就更高。


這一點幾乎成為了最近AI廠商們的一種「陽謀」——


畢竟鼓勵語音交互一方面好處多多,另一方面更是將token消耗量推上一個新臺階,沒有廠商會和收費過不去。


因此,對于模型廠商以及配件品牌來說,未來AI業(yè)務的競爭不只是能不能聽懂人話。


更關鍵的是,誰能以更低延遲、更少冗算和更透明的計費,調和好不同模態(tài)業(yè)務之間巨大的成本差異。


畢竟讓人們開口對AI講話并不難,真正難的是讓人們想要一直說下去。

AI原生產品日報頻道: 前沿科技
本內容來源于網絡 原文鏈接,觀點僅代表作者本人,不代表虎嗅立場。
如涉及版權問題請聯(lián)系 hezuo@huxiu.com,我們將及時核實并處理。
正在改變與想要改變世界的人,都在 虎嗅APP
汉寿县| 齐河县| 慈溪市| 西充县| 五台县| 汉中市| 台中县| 随州市| 桂阳县| 灵丘县| 锦屏县| 中西区| 高青县| 凌云县| 郴州市| 荣成市| 桦川县| 孙吴县| 房山区| 长白| 岳池县| 韩城市| 砚山县| 米易县| 万盛区| 泰宁县| 哈尔滨市| 凤翔县| 日照市| 晋江市| 南溪县| 云浮市| 永安市| 遂川县| 竹山县| 怀集县| 扎囊县| 双鸭山市| 云梦县| 资阳市| 荔浦县|