Riassunto:
Negli ultimi giorni tutti devono essere rimasti infastiditi dalla nuova funzione di test in scala di grigi di WeChat. Innanzitutto, in modalità di input vocale, il bordo di "tieni premuto per parlare" diventa improvvisamente spesso e nero, per paura di non poterlo vedere. Quindi, nella modalità di immissione del testo, la casella di immissione ti ricorda effettivamente:
Puoi tenere premuto per convertire il testo.


Cosa significa?
In the past, "Press and hold to speak" required you to switch to voice mode before you could use it. Ciò che hai lasciato andare era la voce originale, e ciò che si sentiva dall'altra parte era la tua dannatamente affascinante voce in bolla (a meno che tu non scegliessi attivamente di convertirla in testo).

Ma ora devi solo tenere premuta la casella di input per parlare e la voce si trasformerà direttamente in testo e verrà inviata quando lasci la presa.

A prima vista sembra molto conveniente. Puoi inviarlo direttamente dopo averlo detto. Tuttavia, la prima reazione di molti netizen è quella di lamentarsi, ed è troppo facile innescare accidentalmente la morte sociale.

Ma oggi il recensore cattivo non si lamenta di questo.
Hai notato che in questa app ci sono troppi posti per l'input vocale?
Devi sapere che qualche tempo fa WeChat ha semplicemente inserito un pulsante del microfono (+1) sul lato destro della casella di input e puoi convertire la voce in testo con un solo clic. Inoltre, questa volta tieni premuta la casella di immissione (+1), tieni premuta per parlare in modalità vocale (+1), nonché il tasto vocale del metodo di immissione (+1) e la dettatura propria del sistema (+1).
Ora quando apri WeChat, ci sono 5 portali vocali nella metà inferiore dello schermo in attesa che tu parli.

Guigui, vuoi davvero ascoltare il subwoofer di Mr. Bad Review?
Sarebbe bello se questa situazione apparisse solo in WeChat sul cellulare. Il problema è che ormai molte app sono così, dal cellulare al computer.
Ad esempio, la versione desktop per Mac di WeChat aveva già lo stesso messaggio, che diceva di tenere premuto Fn per inserire il testo tramite la voce.

Nella casella di input sul desktop Feishu, c'è anche una riga "Tieni premuto Fn per parlare" per convertire la voce in testo.

Fratelli, davvero non sapete quanto sia importante Fn sul Mac, vero? Tutti i tasti ad alta frequenza nel metodo di immissione e nell'area funzionale sono occupati dalla tua voce?
Non preoccuparti, è qui che stiamo andando.
Nel documento Feishu, se apri una griglia in una tabella, scoprirai che c'è anche un testo di sintesi vocale nell'angolo in alto a destra.

Mettiamola in questo modo, se apri adesso una qualsiasi delle grandi app di fabbrica, vedrai un gruppo di microfoni che ti salutano: Zio, vieni da me...

Siamo ragionevoli e diamo un input vocale, nessuno ha obiezioni, le scelte multiple sono sempre una buona cosa.
Ma la posizione attuale è ovviamente più che "darti più opzioni":
Alcuni usano il testo per ricordarti, altri mettono l'ingresso nel posto più evidente e altri semplicemente rendono il pulsante molto grande.
Sembra che i principali produttori abbiano stretto un accordo per dare priorità alla voce, per paura che non si parli nell'app.
Vedendo questo, sarai curioso di sapere perché: qual è la magia di questo input vocale?
All'inizio, il recensore negativo pensava che fosse abbastanza semplice, facile da usare ed economico.
L'efficienza di input è elevata rispetto al Pinyin e il costo non è elevato.
Secondo il prezzo sul sito ufficiale di Volcano Engine, il riconoscimento vocale in streaming di Doubao costa meno di 1 yuan l'ora. Anche se un utente abituale invia 10 minuti di discorso ogni giorno, costa solo 60 yuan all'anno. Questo è ancora il prezzo al dettaglio e per i principali produttori sarà più economico utilizzare i propri modelli.

Ma il problema è:
L'input vocale non è affatto una novità. Siri è in grado di scrivere sotto dettatura più di dieci anni fa e la ricerca vocale su Amap è disponibile da molti anni. Perché la priorità vocale è così alta adesso?
Più tardi ci ho pensato e ho capito che la chiave potrebbe risiedere nel metodo di input.
Ho già scritto in precedenza sui metodi di input dei principali produttori, dicendo che il metodo di input è come una guardia di sicurezza che sorveglia la porta di tutte le app. Prima conosce tutte le tue esigenze e poi l'app.
Ad esempio, se fai una domanda nell'app Doubao, il metodo di immissione WeChat potrebbe averti sbattuto in faccia la risposta prima di fare clic su Invia.

Allo stesso modo, se invii un messaggio in WeChat e lo digiti utilizzando il metodo di input Beanbao, WeChat sicuramente non vorrà vedere questa scena.
Molti anni fa, il metodo di input Sogou ha superato Baidu.
Gli utenti sono tutti su Baidu e le parole candidate che appaiono durante la digitazione vengono portate direttamente a Sogou per la ricerca.

Quindi Google Apps deve pensare: esiste un modo in cui gli utenti possono interagire direttamente con me e aggirare la sicurezza del metodo di input?
Discorso al testo.
In effetti, questa tecnologia esisteva molti anni fa, ma a quel tempo il costo era elevato e la precisione era bassa.
Con lo sviluppo di modelli vocali su larga scala negli ultimi due anni, la sua precisione e velocità di risposta sono diventate quasi perfette.
Si può dire che la voce in testo supportata dall'intelligenza artificiale dà all'app la possibilità di funzionare da sola per la prima volta senza timore di essere intercettata dal metodo di input.

Ma questa è solo "difesa". Guardiamo un po’ oltre: i grandi produttori sono effettivamente all’offensiva, cogliendo in anticipo l’ingresso nella prossima generazione di interazioni.
Oggi, se tieni premuto per parlare, l'App ti aiuterà a convertire le tue parole in parole; domani, se tieni premuto per parlare, l'App prenoterà direttamente il volo per te?
Esistono già alcune app native dell'intelligenza artificiale che possono farlo, ma anche app come WeChat e Feishu vogliono andare in questa direzione, quindi addestrano prima gli utenti a parlare e poi addestrano gli utenti ad avere conversazioni dirette con gli agenti per soddisfare le loro esigenze.
Nella prossima generazione di app, devi aprire la bocca e parlare → L'intelligenza artificiale farà direttamente il lavoro.
Ma questo processo deve essere graduale.
Quindi ora le principali app devono fare del loro meglio per guidare e coltivare l'abitudine degli utenti di parlare nelle proprie app, per poi integrare gradualmente varie funzioni di riepilogo e ricerca AI nei comandi vocali.
Ecco perché tutti stanno promuovendo il riconoscimento vocale.

Ma questa non è la fine.
In futuro questo fenomeno si diffonderà anche alla maggior parte delle app sul mercato.
Perché nell'era incrementale tutti competono con chi può correre più veloce, mentre nell'era delle azioni tutti competono con chi può mordere più forte. Quando la torta non diventa più grande, ogni famiglia può prendere solo ciò che ha nella propria ciotola.
In questa situazione, qualsiasi funzione che possa essere combinata con l'intelligenza artificiale e rendere gli utenti dipendenti, finché lo fa la prima azienda, la seconda seguirà. Poiché gli utenti sono dipendenti, la domanda del mercato cambierà e, se non lo fai, verrai derubato degli utenti.
Non credermi, critica te stesso e basta. Sono un esempio vivente di essere stato formato con successo da una grande azienda.
Quando ho visto per la prima volta queste voci vocali, ho pensato: scrivo da più di dieci anni e la velocità della mia mano non è stata lenta, quindi perché dovrei parlare con il mio telefono?
Dopo averlo provato più volte, ho scoperto che il riconoscimento è davvero veloce e preciso e che eventuali ambiguità possono essere corrette automaticamente.
Qualche mese fa per impostazione predefinita utilizzavo ancora la digitazione e utilizzavo solo la voce perché ero troppo pigro per farlo...
E adesso?
Non scrivo mai quando posso aprire bocca. Anche quando sono seduto in ufficio a scrivere un manoscritto, voglio dettare. Le mie dita non sono più doloranti e la mia velocità di input è più veloce. Al contrario, quando ogni tanto torno al metodo di input, mi chiedo perché sia così faticoso.

Naturalmente la mia dipendenza dall'intelligenza artificiale va ben oltre questo.
Ora che vedo un articolo lungo, non ho la pazienza di leggerlo dall'inizio alla fine, quindi lascio semplicemente all'intelligenza artificiale il compito di riassumere i punti chiave. Se voglio verificare qualche notizia o video su Twitter, @Grok lo lascerà andare; quando di solito cerco informazioni, leggo semplicemente il riepilogo dell'IA e, se è difficile, lascio che vari agenti risolvano il problema per me.

Non ho prestato molta attenzione a queste funzioni quando sono apparse per la prima volta, ma dopo averle sperimentate alcune volte, non potrei vivere senza senza nemmeno rendermene conto.
Quando entrambi ci affidiamo all'intelligenza artificiale in questo modo, la domanda del mercato viene sottilmente riscritta.
Non tutti saranno in grado di utilizzare un'app senza la voce AI e il riepilogo AI. Per adattarsi al mercato, gli sviluppatori di app dovranno naturalmente adeguarsi per fornire queste funzioni.
Forse presto il metodo di input non sarà più una necessità.
Quando abbiamo iniziato a parlare di questo argomento, la redazione stava ancora scherzando:
Se l'input vocale continua in questo modo, i giovani in futuro potrebbero non essere nemmeno in grado di digitare pinyin.
All'inizio potrebbe sembrare un po' spaventoso, ma quando arriverà il giorno, non avrà importanza se non riesci a digitare pinyin? Ogni generazione ha le proprie competenze. La generazione precedente pensava che non potessimo riparare le lampadine o digitare la tastiera a cinque tempi, ma vivevamo comunque una bella vita.
Il metodo di input non è mai stato l'obiettivo, è solo un modo per connettere persone e macchine. Quando un giorno una nuova strada diventerà più conveniente, nessuno perderà la vecchia strada.
La ruota dei tempi avanza e ci sono sempre alcune competenze che scompariranno lentamente con l'evoluzione del modo in cui opera la società.
Commenti