賈瀞雯看著那份測試報告,眉頭皺起來。
百分之六十二,意味著每三句話裡就有一句識別錯誤。
這樣的產品,根本沒法用。
“瓶頸在哪兒?”她問。
“資料。”張濤說,“語音識別需要大量標註好的語音資料。
我們沒有這方面的積累,要從零開始收集。
還有演算法,現有模型對噪聲、口音的適應性很差。”
賈瀞雯記下這些,當晚就彙報給了陳浩。
陳浩聽完,沉默了一會兒。
“百分之六十二,比我預期的好一點。”他說,“我本來以為會更差。”
“那怎麼辦?”賈瀞雯問。
“別急。”陳浩說,“語音識別是長期工程。
先收集資料,最佳化模型。
我把手頭一些資料發給你,可能有用。”
幾天後,賈瀞雯收到一個壓縮包。
裡面是幾十篇論文和技術文件,都是關於語音識別的最新研究。
有些是英文的,有些是中文的,還有一些是手寫的筆記——陳浩的字跡。
她把這些資料轉給張濤。
張濤看了之後,興奮地打電話來:“賈總,這些資料太及時了!有幾篇論文正好解決了我們遇到的問題。”
接下來的幾個月,語音搜尋團隊邊學邊做。
資料從幾萬條積累到幾十萬條,模型從簡單到複雜。
準確率從百分之六十二慢慢爬到百分之六十七、六十九。
但到了百分之七十,又卡住了。
“七十是個坎。”張濤在評審會上說,“再往上,需要的計算量和資料量成倍增加。
我們現有的算力不夠,資料也不夠。”
“需要什麼?”賈瀞雯問。
“至少再翻一倍的伺服器,還要更多的標註資料。”張濤說,“投入可能要翻番。”
賈瀞雯算了一下。
。源資案專他其從要還至甚,去進投都餘盈部全的盟聯告廣移把著味意番翻
。了豫猶
。浩陳給拋題難個這把,片影的晚當
。答回上馬沒,完聽浩陳
。麼什著畫上紙在,筆起拿他
。配匹去索搜用再,字文轉音聲把是,別識音語的統傳“,說他”。路思個一到想我,雯瀞“
”?節環個一過跳,能可有沒有但
”?思意麼什“
。氣天搜再,字個幾這’報預氣天‘別識先是不統系,’報預氣天‘說者用使如比“,說浩陳”。聯關的間之果結尋搜和徵特音聲立建接直“
”。圖意個這氣天到配匹徵特音聲從接直是而
。象很來起聽“:想了想雯瀞賈
”?嗎現實能上技
”。看看隊團讓,你給發架框個寫我“,說浩陳”。新創法算演要需“
。箱郵雯瀞賈到發件文寫手的頁十二達長份一,後天兩
。式公學數些一有還,釋註的麻麻,圖程流的畫筆鉛用浩陳








