久操免费资源,久久伦理一区,国产又黄又爽视频,情草av网,日本久久久在线免费,精品人妻互换一区三区,熟妇女一区二区三区,亚洲AV三区视频免费,老司机在线精品

OpenAI推出全雙工語(yǔ)音模型GPT-Live改進(jìn)ChatGPT語(yǔ)音體驗(yàn),但首批反饋負(fù)面居多,暴露了當(dāng)前實(shí)時(shí)語(yǔ)音交互的核心痛點(diǎn)。 ## 1. 升級(jí)背景與核心改進(jìn) OpenAI在GPT-Live之前推出的兩代ChatGPT Voice均未脫離回合制,需要判斷用戶(hù)發(fā)言結(jié)束后才作答,易出現(xiàn)誤判插話(huà)等問(wèn)題。GPT-Live通過(guò)兩項(xiàng)架構(gòu)升級(jí)改進(jìn)體驗(yàn):一是引入全雙工架構(gòu),可同時(shí)聽(tīng)、說(shuō)并每秒多次做交互決策,能給出“嗯嗯”這類(lèi)短情緒反饋;二是拆分功能,GPT-Live作為實(shí)時(shí)語(yǔ)音交互層負(fù)責(zé)把控對(duì)話(huà)節(jié)奏,復(fù)雜任務(wù)交給后臺(tái)GPT-5.5處理。 ## 2. 覆蓋范圍與官方評(píng)測(cè)情況 GPT-Live現(xiàn)已向全球iOS、Android端ChatGPT用戶(hù)及網(wǎng)頁(yè)端用戶(hù)開(kāi)放,Go/Plus/Pro用戶(hù)默認(rèn)使用GPT-Live-1,免費(fèi)用戶(hù)默認(rèn)使用GPT-Live-1 mini,推出暫不支持語(yǔ)音/視頻通話(huà)、屏幕共享,官方正在適配。官方僅做縱向?qū)Ρ?,稱(chēng)GPT-Live在科學(xué)推理、網(wǎng)頁(yè)搜索、電信客服三類(lèi)任務(wù)上表現(xiàn)優(yōu)于此前的Advanced Voice,但未給出行業(yè)橫向?qū)Ρ冉Y(jié)果。 ## 3. 用戶(hù)反饋與現(xiàn)存問(wèn)題 目前用戶(hù)對(duì)GPT-Live評(píng)價(jià)兩極分化,部分用戶(hù)認(rèn)可其技術(shù)潛力,認(rèn)為或能改變部分場(chǎng)景使用習(xí)慣。大量用戶(hù)反饋其問(wèn)題:短反饋過(guò)多過(guò)于頻繁,令人生厭;實(shí)時(shí)模式無(wú)法調(diào)用ChatGPT記憶,無(wú)法在攝像頭、屏幕共享模式下使用。 ## 4. 語(yǔ)音助手的核心考驗(yàn) 目前每周超1.5億用戶(hù)通過(guò)語(yǔ)音功能和ChatGPT交互,日常場(chǎng)景是語(yǔ)音功能的核心使用場(chǎng)景。語(yǔ)音交互和文字交互不同,聲音會(huì)直接搶占注意力,對(duì)延遲和分寸感要求更高,不打擾用戶(hù)才是語(yǔ)音助手能被用戶(hù)接受的核心前提。GPT-Live的嘗試補(bǔ)全了ChatGPT Voice的日常體驗(yàn)短板,其暴露出的問(wèn)題也是行業(yè)普遍會(huì)遇到的問(wèn)題,仍需要迭代優(yōu)化。
OpenAI的新語(yǔ)音模型,先把用戶(hù)煩到了
2026-07-09 08:25

OpenAI的新語(yǔ)音模型,先把用戶(hù)煩到了

本文來(lái)自微信公眾號(hào):字母AI,作者:袁心玥,題圖來(lái)自:AI生成


在昨夜凌晨的直播中,OpenAI發(fā)布了新一代語(yǔ)音模型GPT-Live,并宣布它將開(kāi)始驅(qū)動(dòng)ChatGPT Voice。



上次ChatGPT Voice的代際更新,還是2024年5月GPT-4o發(fā)布時(shí)展示的Advanced Voice;同年7月,它開(kāi)始向部分Plus用戶(hù)小范圍推出。到GPT-Live發(fā)布,已經(jīng)過(guò)去了兩年。


這一次,OpenAI把full-duplex,也就是全雙工架構(gòu),帶進(jìn)了ChatGPT Voice。


過(guò)去的AI語(yǔ)音助手,大多像一臺(tái)反應(yīng)很快的對(duì)講機(jī):用戶(hù)說(shuō)完一句,模型再回一句;模型說(shuō)話(huà)時(shí),用戶(hù)可以打斷,但系統(tǒng)往往要重新判斷、重新組織回答。


它已經(jīng)像對(duì)話(huà),卻還不夠自然,不像真正的聊天。


GPT-Live要解決的,正是這層微妙的差別。


該功能今天將在ChatGPT上正式啟用。但……反響似乎并不算很好?




對(duì)ChatGPT Voice的一次補(bǔ)課


在真實(shí)聊天里,除了打辯論,人和人很少是一句接一句、整整齊齊地輪流發(fā)言。我們會(huì)停頓,會(huì)猶豫,會(huì)突然改口,也會(huì)在對(duì)方說(shuō)話(huà)時(shí)補(bǔ)一句“等等,不是這個(gè)意思”。


有時(shí)候,一聲“嗯嗯”“我懂”,比一段完整回答更重要;有時(shí)候,最好的回應(yīng)反而是先不要說(shuō)話(huà),讓對(duì)方繼續(xù)往下說(shuō)。


過(guò)去的AI語(yǔ)音助手,最難處理的正是這些細(xì)節(jié)。


無(wú)論是ChatGPT、Gemini還是我們最熟悉的豆包,它們?cè)凇傲奶臁鄙隙己芨蓾?,很有人機(jī)感。


它們可以回答問(wèn)題,可以讀出文字,也可以在用戶(hù)打斷時(shí)停止。但它們通常仍然依賴(lài)一個(gè)前提:先判斷用戶(hù)是不是已經(jīng)說(shuō)完了,再?zèng)Q定模型該不該說(shuō)話(huà)。判斷一旦出錯(cuò),對(duì)話(huà)就會(huì)變得別扭。


用戶(hù)只是停頓了一秒,它可能以為問(wèn)題結(jié)束了,急著接話(huà);用戶(hù)說(shuō)到一半改了主意,它可能還在沿著上一句話(huà)往下答;背景里有人說(shuō)話(huà),它也可能把不屬于用戶(hù)的聲音當(dāng)成輸入。


GPT-Live要改善的,就是這些很難被包裝成“大功能”、但會(huì)直接決定體驗(yàn)的小問(wèn)題。


要理解現(xiàn)在的GPT-Live,先要看OpenAI此前的語(yǔ)音系統(tǒng)是怎么工作的。


最早的ChatGPT Voice,采用的是級(jí)聯(lián)語(yǔ)音系統(tǒng)(cascaded voice system)。


簡(jiǎn)單說(shuō),它不是一個(gè)模型從頭到尾處理語(yǔ)音,而是由多個(gè)模型接力完成:先把用戶(hù)的語(yǔ)音轉(zhuǎn)成文字,再讓大語(yǔ)言模型根據(jù)文字生成回答,最后再把文字轉(zhuǎn)換成語(yǔ)音。


這套方案的好處是容易搭建,也能很快把大語(yǔ)言模型接進(jìn)語(yǔ)音交互里。但它的問(wèn)題也很明顯:語(yǔ)音里的大量信息,會(huì)在“語(yǔ)音轉(zhuǎn)文字”的第一步就丟失。


模型生成回答時(shí),它看到的往往只是一段被整理過(guò)的文字,而不是完整的對(duì)話(huà)現(xiàn)場(chǎng)。用戶(hù)的語(yǔ)氣、停頓、情緒變化,并不會(huì)進(jìn)入后面的語(yǔ)言模型。再加上多個(gè)模型串聯(lián),延遲也會(huì)被一層層疊加,語(yǔ)音助手就很容易變成“聽(tīng)一句、想一下、再念一句”。



GPT-4o之后,OpenAI推出了Advanced Voice,開(kāi)始用原生音頻模型直接處理和生成聲音。


相比級(jí)聯(lián)系統(tǒng),這是一次明顯的進(jìn)步:模型不用先把所有語(yǔ)音轉(zhuǎn)成文字,再繞一圈生成語(yǔ)音;它能保留更多音頻細(xì)節(jié),延遲也更低,用戶(hù)可以更自然地打斷。


但Advanced Voice仍然沒(méi)有完全擺脫回合制。


OpenAI在介紹GPT-Live時(shí),把此前的Advanced Voice稱(chēng)為回合制語(yǔ)音模型(turn-based voice model)。它已經(jīng)比傳統(tǒng)語(yǔ)音助手更自然,但仍然要先判斷用戶(hù)是否說(shuō)完,再?zèng)Q定模型是否應(yīng)該開(kāi)始回答。


這個(gè)機(jī)制在文本聊天里沒(méi)有問(wèn)題,用戶(hù)按下發(fā)送鍵,就等于明確告訴模型這一輪輸入結(jié)束了——但語(yǔ)音聊天并不會(huì)有那個(gè)按鈕,什么時(shí)候應(yīng)該回答,需要由模型自己判斷。


用戶(hù)停頓一秒,可能是說(shuō)完了,也可能只是還在想;用戶(hù)拖長(zhǎng)音,可能是在組織語(yǔ)言,也可能是醞釀情緒;背景里傳來(lái)別人的聲音,可能被誤判成新的輸入。


回合制語(yǔ)音模型最難處理的,就是這個(gè)邊界。



GPT-Live通過(guò)兩項(xiàng)架構(gòu)上的改進(jìn),去解決這個(gè)問(wèn)題。


第一項(xiàng)改進(jìn),是把語(yǔ)音對(duì)話(huà)從“輪流發(fā)言”推進(jìn)到full-duplex。


它可以持續(xù)聽(tīng)、持續(xù)判斷、持續(xù)生成語(yǔ)音,而不只是在用戶(hù)結(jié)束發(fā)言后才進(jìn)入回答狀態(tài)。


或者說(shuō),模型在參與一場(chǎng)仍在發(fā)生的對(duì)話(huà),而不只是回答一個(gè)已經(jīng)結(jié)束的問(wèn)題。


根據(jù)官方介紹,GPT-Live每秒可以做出多次交互決策:是繼續(xù)說(shuō)話(huà)、繼續(xù)傾聽(tīng)、暫停、打斷對(duì)方的話(huà)語(yǔ),還是調(diào)用某個(gè)工具。這讓它能夠進(jìn)行更自然的互動(dòng)交流、更好地把握時(shí)間順序,甚至可以實(shí)時(shí)翻譯。



可以看到,在用戶(hù)說(shuō)話(huà)的過(guò)程中,GPT-Live會(huì)給出一些情緒上的回應(yīng)。就像你和你朋友煲電話(huà)粥,總會(huì)夾雜著一些“嗯”“哦”的聲音。


事實(shí)上,GPT-Live并不是第一個(gè)嘗試全雙工架構(gòu)的語(yǔ)音模型。此前Kyutai的Moshi、英偉達(dá)的PersonaPlex,以及一批學(xué)術(shù)模型,已經(jīng)在探索讓AI同時(shí)聽(tīng)和說(shuō),處理停頓、插話(huà)和短反饋;谷歌的Gemini Live雖然沒(méi)有強(qiáng)調(diào)全雙工,但也已經(jīng)在做實(shí)時(shí)語(yǔ)音對(duì)話(huà)和原生音頻模型,方向上非常接近。


GPT-Live的不同之處,是把“邊聽(tīng)邊說(shuō)”的能力帶進(jìn)了ChatGPT這個(gè)主流入口,并且能和OpenAI的其它模型一起配合。


這就要說(shuō)到第二項(xiàng)改進(jìn):語(yǔ)音交互層和后臺(tái)智能之間的分工。


GPT-Live并不只是一個(gè)“更會(huì)說(shuō)話(huà)的模型”,它更像ChatGPT的實(shí)時(shí)語(yǔ)音交互層:負(fù)責(zé)聽(tīng)、說(shuō)、等待、打斷、判斷何時(shí)回應(yīng),也負(fù)責(zé)維持對(duì)話(huà)節(jié)奏。


遇到需要搜索、推理或復(fù)雜任務(wù)的問(wèn)題時(shí),它可以把任務(wù)交給背后的更強(qiáng)模型處理。


語(yǔ)音模型不必在每一句話(huà)里都承擔(dān)全部智能壓力。簡(jiǎn)單問(wèn)題可以快速回答,復(fù)雜問(wèn)題可以調(diào)用更高強(qiáng)度的推理;對(duì)話(huà)層負(fù)責(zé)保持流暢,后臺(tái)模型負(fù)責(zé)完成真正的思考和任務(wù)處理。


這個(gè)架構(gòu)同樣不是很新,但不新,并不代表不好用。



我更愿意理解為這是OpenAI對(duì)ChatGPT Voice的一次補(bǔ)課:把過(guò)去已經(jīng)在行業(yè)里出現(xiàn)的實(shí)時(shí)語(yǔ)音交互能力,和full-duplex語(yǔ)音結(jié)合起來(lái),然后塞到ChatGPT里。


評(píng)測(cè)與評(píng)價(jià)


GPT-Live的實(shí)際效果,現(xiàn)在還不適合下太滿(mǎn)的結(jié)論。


每次發(fā)布新模型,OpenAI都很擅長(zhǎng)圍繞新能力重新定義一套評(píng)估標(biāo)準(zhǔn)。模型會(huì)推理,就強(qiáng)調(diào)推理;模型會(huì)寫(xiě)代碼,就強(qiáng)調(diào)代碼。


這次它同樣給出了一套自己的評(píng)估結(jié)果,包括對(duì)中斷、等待、短反饋、背景噪音、語(yǔ)音理解等能力的測(cè)試。



根據(jù)這套新建的評(píng)估標(biāo)準(zhǔn),在5到10分鐘的匹配語(yǔ)音對(duì)話(huà)中,評(píng)測(cè)者明顯更偏好GPT-Live-1和GPT-Live-1 mini。


除此之外,還有一些別的榜單,或許值得一看。


OpenAI稱(chēng),GPT-Live-1在GPQA、BrowseComp和內(nèi)部版本的τ3-Voice Telecom上都超過(guò)Advanced Voice Mode,分別對(duì)應(yīng)科學(xué)推理、網(wǎng)頁(yè)搜索和多輪電信客服任務(wù)。




但這部分也不能簡(jiǎn)單理解成“GPT-Live這個(gè)語(yǔ)音模型本身變聰明了”。因?yàn)镚PT-Live在遇到搜索、推理和復(fù)雜任務(wù)時(shí),會(huì)把任務(wù)交給背后的GPT-5.5。


換句話(huà)說(shuō),官方評(píng)估更像是在證明新的ChatGPT Voice系統(tǒng)更強(qiáng),而不是單獨(dú)證明語(yǔ)音交互層本身已經(jīng)完成了質(zhì)變。


而且你們可能已經(jīng)注意到了,它只做了縱向比較(和自己以前的模型作對(duì)比),橫向是一點(diǎn)也沒(méi)提。


我們無(wú)從得知,GPT-Live放到整個(gè)語(yǔ)音AI行業(yè)里,到底處在什么位置。


網(wǎng)友對(duì)此的評(píng)價(jià)比較兩極分化。


一部分人認(rèn)為,這次更新具有非常大的潛力,如果能用在編程上,或許會(huì)改變很多人的習(xí)慣。






但也有很多網(wǎng)友認(rèn)為,GPT-Live這種頻頻回應(yīng)的方式有些令人生厭。




還有人指出了它現(xiàn)在的問(wèn)題,比如在實(shí)時(shí)模式下無(wú)法查詢(xún)到ChatGPT的記憶,又比如明明是語(yǔ)音功能,卻在攝像頭模式和屏幕共享模式下無(wú)法使用。




對(duì),是的,無(wú)法使用。


根據(jù)官方文檔,GPT-Live現(xiàn)已在全球范圍內(nèi)向所有使用iOS、Android系統(tǒng)的ChatGPT用戶(hù)以及ChatGPT.com的用戶(hù)開(kāi)放。對(duì)于Go、Plus和Pro版用戶(hù)來(lái)說(shuō),GPT-Live-1將成為驅(qū)動(dòng)ChatGPT Voice功能的默認(rèn)模型;而對(duì)于免費(fèi)用戶(hù)而言,GPT-Live-1 mini則將成為默認(rèn)模型。


在推出時(shí),GPT-Live不支持在ChatGPT中進(jìn)行語(yǔ)音通話(huà)、視頻通話(huà)或屏幕共享功能。官方正在努力盡快添加這些功能,用戶(hù)仍然可以使用ChatGPT Voice的舊版本,包括標(biāo)準(zhǔn)語(yǔ)音模式和高級(jí)語(yǔ)音模式,這些版本中包含上述功能。


語(yǔ)音助手,先要變得不煩人


OpenAI披露,每周已經(jīng)有超過(guò)1.5億人通過(guò)Voice和Dictation與ChatGPT說(shuō)話(huà)。用戶(hù)拿它做的事情很日常:騰不出手時(shí)問(wèn)點(diǎn)日常問(wèn)題,練外語(yǔ),講睡前故事,通勤路上聊天。


這些事情算不上很炫酷,卻是語(yǔ)音功能最真實(shí)的使用場(chǎng)景。


根據(jù)官方文檔,OpenAI這次把升級(jí)拆成了四個(gè)方向:更自然的對(duì)話(huà)、更聰明的回答、更好的聆聽(tīng),以及可視化回答。


更自然的對(duì)話(huà),對(duì)應(yīng)的是用戶(hù)可以中途插話(huà),可以停下來(lái)想一想,也可以要求ChatGPT放慢語(yǔ)速。模型會(huì)用“嗯嗯”“明白”這類(lèi)短反饋表示自己在聽(tīng),而不是永遠(yuǎn)等到用戶(hù)說(shuō)完才突然開(kāi)始輸出一大段回答。


OpenAI還重新處理了ChatGPT里的九種聲音,讓它們更適配GPT-Live。


更聰明的回答,對(duì)應(yīng)的是語(yǔ)音模式和最新前沿模型的連接。用戶(hù)可以選擇不同推理強(qiáng)度:Instant用來(lái)快速回答,Medium和High則給需要更多思考的問(wèn)題使用。


這個(gè)設(shè)計(jì)其實(shí)挺現(xiàn)實(shí)的,因?yàn)檎Z(yǔ)音場(chǎng)景對(duì)延遲非常敏感。問(wèn)一個(gè)簡(jiǎn)單問(wèn)題時(shí),你可能希望它立刻回答;討論一個(gè)復(fù)雜問(wèn)題時(shí),又需要它真的多想一會(huì)兒。


更好的聆聽(tīng),則是這次升級(jí)里最接近日常體驗(yàn)的一點(diǎn)。用戶(hù)停頓時(shí),ChatGPT Voice應(yīng)該等待,而不是急著插話(huà);用戶(hù)要求它先安靜聽(tīng),它就應(yīng)該保持安靜;背景里有車(chē)聲、旁邊人說(shuō)話(huà)時(shí),它也要更專(zhuān)注于用戶(hù)本人的聲音。


對(duì)語(yǔ)音助手來(lái)說(shuō),這些能力聽(tīng)起來(lái)不如“推理更強(qiáng)”響亮,但往往決定用戶(hù)愿不愿意繼續(xù)用。


當(dāng)然,從首批反饋看,GPT-Live還沒(méi)有完全解決這個(gè)問(wèn)題。有用戶(hù)認(rèn)為它的短反饋過(guò)多,甚至?xí)兂闪硪环N打擾。但我覺(jué)得可以給它一點(diǎn)時(shí)間。


最后是可視化回答。OpenAI 提到,用戶(hù)說(shuō)話(huà)時(shí),ChatGPT可以展示天氣、股票、體育等視覺(jué)卡片;Voice也繼續(xù)支持搜索、記憶、圖片和文件上傳。


這說(shuō)明OpenAI在把語(yǔ)音和屏幕信息重新組合起來(lái):適合聽(tīng)的,用聲音說(shuō);適合看的,就直接展示。


過(guò)去,語(yǔ)音更多是文本框的替代品。用戶(hù)不想打字,就對(duì)著手機(jī)說(shuō)一句;模型生成回答,再把文字念出來(lái)。它本質(zhì)上還是文本交互的延伸,只是把鍵盤(pán)換成了麥克風(fēng),把屏幕上的文字換成了聲音。


但包括GPT-Live在內(nèi)的、當(dāng)下的語(yǔ)音助手指向了另一種產(chǎn)品形態(tài):語(yǔ)音不再只是輸入輸出通道,而是AI參與現(xiàn)實(shí)任務(wù)的實(shí)時(shí)入口。


GPT-Live的重點(diǎn)并不是要把ChatGPT從文本框里徹底解放出來(lái)。更準(zhǔn)確地說(shuō),它是在補(bǔ)ChatGPT Voice的日常使用感。


不過(guò),這件事要成立有一個(gè)前提:它會(huì)不會(huì)少打擾用戶(hù)。


語(yǔ)音助手和文字助手最大的不同是,文字可以被忽略,可以慢慢讀,也可以隨時(shí)關(guān)掉;但聲音會(huì)直接闖進(jìn)人的注意力里。它接話(huà)太急、短反饋太多、判斷錯(cuò)停頓,用戶(hù)感受到的就不是智能,而是煩人。


GPT-Live的真正考驗(yàn)也在這里。


這次更新無(wú)疑是有價(jià)值的,它讓AI語(yǔ)音助手變得更順,也暴露出了變順之后,它可能碰上什么問(wèn)題。GPT-Live現(xiàn)在暴露出的問(wèn)題,可能也會(huì)是其它AI語(yǔ)音助手未來(lái)(或者已經(jīng)存在)的問(wèn)題。


我想,我們需要一點(diǎn)耐心。


本文來(lái)自微信公眾號(hào):字母AI,作者:袁心玥

AI原生產(chǎn)品日?qǐng)?bào)頻道: 前沿科技
本內(nèi)容由作者授權(quán)發(fā)布,觀(guān)點(diǎn)僅代表作者本人,不代表虎嗅立場(chǎng)。
如對(duì)本稿件有異議或投訴,請(qǐng)聯(lián)系 tougao@huxiu.com。
正在改變與想要改變世界的人,都在 虎嗅APP
南汇区| 大英县| 犍为县| 冀州市| 拉萨市| 扶沟县| 庆云县| 山西省| 赞皇县| 潍坊市| 论坛| 军事| 商水县| 兖州市| 建始县| 大安市| 台南市| 上林县| 洪泽县| 稷山县| 仁怀市| 绥化市| 陆川县| 明溪县| 赞皇县| 红原县| 长乐市| 古丈县| 周至县| 区。| 太保市| 永城市| 自治县| 油尖旺区| 井冈山市| 三台县| 清新县| 乌拉特后旗| 庆安县| 宁津县| 延津县|