{"id":1808,"date":"2023-06-19T13:41:01","date_gmt":"2023-06-19T13:41:01","guid":{"rendered":"https:\/\/aiguiden.com\/?p=1808"},"modified":"2023-06-19T13:44:50","modified_gmt":"2023-06-19T13:44:50","slug":"meta-visar-upp-voicebox-en-ny-rostmodell-men-vagar-inte-slappa-ut-den-da-den-ar-for-bra","status":"publish","type":"post","link":"https:\/\/aiguiden.com\/index.php\/2023\/06\/19\/meta-visar-upp-voicebox-en-ny-rostmodell-men-vagar-inte-slappa-ut-den-da-den-ar-for-bra\/","title":{"rendered":"Meta visar upp Voicebox, en ny r\u00f6stmodell men v\u00e5gar inte sl\u00e4ppa ut den d\u00e5 den \u00e4r F\u00d6R bra"},"content":{"rendered":"\n<p class=\"wp-block-paragraph\"><strong>Forskare hos Meta AI har gjort ett betydande framsteg inom generativ AI f\u00f6r tal. Nu har dom skapat Voicebox, den f\u00f6rsta modellen som kan anpassa sig till uppgifter i genererat spr\u00e5k som den inte specifikt utbildades f\u00f6r att slutf\u00f6ra, med o\u00f6vertr\u00e4ffad prestanda.<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Fr\u00e5n Metas egen blogg:<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Liksom generativa system f\u00f6r bilder och text skapar Voicebox resultat i en enorm m\u00e4ngd stilar, och kan skapa resultat fr\u00e5n grunden samt modifiera ett prov den f\u00e5tt. Men ist\u00e4llet f\u00f6r att skapa en bild eller ett stycke text, producerar Voicebox ljudklipp av h\u00f6g kvalitet. Modellen kan syntetisera tal p\u00e5 sex spr\u00e5k, samt utf\u00f6ra brusreducering, inneh\u00e5llsredigering, stilomvandling och generera en m\u00e4ngd olika prov.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">F\u00f6re Voicebox kr\u00e4vde generativ AI f\u00f6r tal specifik tr\u00e4ning f\u00f6r varje uppgift med noggrant f\u00f6rberedda tr\u00e4ningsdata. Voicebox anv\u00e4nder en ny metod f\u00f6r att l\u00e4ra sig endast fr\u00e5n r\u00e5 ljud och en medf\u00f6ljande transkription. Till skillnad fr\u00e5n autoregressiva modeller f\u00f6r ljudgenerering, kan Voicebox modifiera vilken del som helst av ett givet prov, inte bara slutet p\u00e5 en ljudklipp som den f\u00e5tt.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Voicebox bygger p\u00e5 en metod som kallas Flow Matching, vilken har visat sig f\u00f6rb\u00e4ttra diffusionsmodeller. Voicebox presterar b\u00e4ttre \u00e4n den nuvarande toppmodellen p\u00e5 engelska, VALL-E, p\u00e5 zero-shot text-till-tal n\u00e4r det g\u00e4ller b\u00e5de intelligibilitet (5,9 procent j\u00e4mf\u00f6rt med 1,9 procent ordfelstakt) och ljudlikhet (0,580 j\u00e4mf\u00f6rt med 0,681), samtidigt som den \u00e4r upp till 20 g\u00e5nger snabbare. F\u00f6r cross-lingual stil\u00f6verf\u00f6ring \u00f6vertr\u00e4ffar Voicebox YourTTS genom att minska den genomsnittliga ordfelstakten fr\u00e5n 10,9 procent till 5,2 procent och f\u00f6rb\u00e4ttrar ljudlikheten fr\u00e5n 0,335 till 0,481.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Voicebox uppn\u00e5r nya b\u00e4sta resultat, och presterar b\u00e4ttre \u00e4n b\u00e5de Vall-E och YourTTS n\u00e4r det g\u00e4ller ordfelstakt.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">flerspr\u00e5kiga benchmarks. Det finns m\u00e5nga sp\u00e4nnande anv\u00e4ndningsomr\u00e5den f\u00f6r generativa talmodeller, men p\u00e5 grund av potentiella risker f\u00f6r missbruk, g\u00f6r vi inte Voicebox-modellen eller koden offentligt tillg\u00e4nglig just nu. \u00c4ven om vi anser att det \u00e4r viktigt att vara \u00f6ppna med AI-gemenskapen och dela v\u00e5r forskning f\u00f6r att f\u00f6rb\u00e4ttra AI:s nuvarande status, \u00e4r det ocks\u00e5 n\u00f6dv\u00e4ndigt att hitta r\u00e4tt balans mellan \u00f6ppenhet och ansvar. Med dessa \u00f6verv\u00e4ganden delar vi idag ljudprover och en forskningsartikel som beskriver v\u00e5r metod och de resultat vi har uppn\u00e5tt. I artikeln detaljerar vi ocks\u00e5 hur vi byggde en mycket effektiv klassificerare som kan skilja mellan autentiskt tal och ljud genererat med Voicebox.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Ett nytt tillv\u00e4gag\u00e5ngss\u00e4tt f\u00f6r talgenerering<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">En av de st\u00f6rsta begr\u00e4nsningarna hos befintliga talgeneratorer \u00e4r att de endast kan tr\u00e4nas p\u00e5 data som har f\u00f6rberetts speciellt f\u00f6r den uppgiften. Dessa indata &#8211; k\u00e4nda som monotona, rena data &#8211; \u00e4r sv\u00e5ra att producera, s\u00e5 de finns endast i begr\u00e4nsade m\u00e4ngder och de resulterar i utdata som l\u00e5ter monotona.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Vi byggde Voicebox baserat p\u00e5 Flow Matching-modellen, vilket \u00e4r Meta&#8217;s senaste framsteg inom icke-autoregressiva generativa modeller som kan l\u00e4ra sig h\u00f6gst icke-deterministisk kartl\u00e4ggning mellan text och tal. Icke-deterministisk kartl\u00e4ggning \u00e4r anv\u00e4ndbart eftersom det m\u00f6jligg\u00f6r f\u00f6r Voicebox att l\u00e4ra av varierade taldatatyper utan att dessa variationer m\u00e5ste noggrant etiketteras. Det betyder att Voicebox kan tr\u00e4na p\u00e5 mer diversifierade data och en mycket st\u00f6rre skala av data.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Vi tr\u00e4nade Voicebox med mer \u00e4n 50 000 timmar inspelat tal och transkript fr\u00e5n ljudb\u00f6cker i det allm\u00e4nna dom\u00e4net p\u00e5 engelska, franska, spanska, tyska, polska och portugisiska. Voicebox \u00e4r tr\u00e4nat att f\u00f6ruts\u00e4ga ett talsegment n\u00e4r det ges det omgivande talet och transkriptet av segmentet. Efter att ha l\u00e4rt sig att inf\u00f6ra tal fr\u00e5n sammanhanget kan modellen sedan till\u00e4mpa detta \u00f6ver talgenereringsuppgifter, inklusive att generera delar i mitten av en ljudinspelning utan att beh\u00f6va \u00e5terskapa hela inmatningen.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Denna m\u00e5ngsidighet g\u00f6r att Voicebox kan prestera bra \u00f6ver en m\u00e4ngd olika uppgifter, inklusive:<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">In-kontext text-till-tal syntes: Genom att anv\u00e4nda ett ljudprov som \u00e4r bara tv\u00e5 sekunder l\u00e5ngt, kan Voicebox matcha provets ljudstil och anv\u00e4nda den f\u00f6r text-till-tal-generering. Framtida projekt kan bygga vidare p\u00e5 denna f\u00f6rm\u00e5ga genom att ge tal till m\u00e4nniskor som inte kan tala, eller genom att l\u00e5ta m\u00e4nniskor anpassa r\u00f6sterna som anv\u00e4nds av icke-spelarkarakt\u00e4rer och virtuella assistenter.<br><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Tv\u00e4rkulturell stil\u00f6verf\u00f6ring: Med ett talprov och ett stycke text p\u00e5 engelska, franska, tyska, spanska, polska eller portugisiska kan Voicebox producera en uppl\u00e4sning av texten p\u00e5 det spr\u00e5ket. Denna f\u00f6rm\u00e5ga \u00e4r sp\u00e4nnande eftersom det i framtiden skulle kunna anv\u00e4ndas f\u00f6r att hj\u00e4lpa m\u00e4nniskor att kommunicera p\u00e5 ett naturligt, autentiskt s\u00e4tt &#8211; \u00e4ven om de inte talar samma spr\u00e5k.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Talavbrusning och redigering: Voicebox&#8217;s in-kontext inl\u00e4rning g\u00f6r den bra p\u00e5 att generera tal f\u00f6r att s\u00f6ml\u00f6st redigera segment inom ljudinspelningar. Den kan \u00e5tersyntetisera den del av talet som korrumperats av kortvarigt brus, eller ers\u00e4tta felaktigt uttalade ord utan att beh\u00f6va spela in hela talet p\u00e5 nytt. En person kan identifiera vilket r\u00e5tt segment av talet som \u00e4r korrumperat av brus (som en hund som sk\u00e4ller), klippa ut det och instruera modellen att \u00e5terskapa det segmentet. Denna f\u00f6rm\u00e5ga kan en dag anv\u00e4ndas f\u00f6r att g\u00f6ra reng\u00f6ring och redigering av ljud lika enkelt som popul\u00e4ra bildredigeringsverktyg har gjort justering av bilder.<br><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Diverse talprovtagning: Eftersom Voicebox har l\u00e4rt sig fr\u00e5n varierande data &#8221;i det vilda&#8221;, kan den generera tal som b\u00e4ttre representerar hur m\u00e4nniskor pratar i den riktiga v\u00e4rlden och p\u00e5 de sex ovan n\u00e4mnda spr\u00e5ken. I framtiden kan denna f\u00f6rm\u00e5ga anv\u00e4ndas f\u00f6r att generera syntetisk data f\u00f6r att b\u00e4ttre tr\u00e4na en talassistentmodell. V\u00e5ra resultat visar att taligenk\u00e4nningsmodeller tr\u00e4nade p\u00e5 Voicebox-genererat syntetiskt tal presterar n\u00e4stan lika bra som modeller tr\u00e4nade p\u00e5 verkligt tal, med 1 procent felstegsf\u00f6rs\u00e4mring j\u00e4mf\u00f6rt med 45 till 70 procent f\u00f6rs\u00e4mring med syntetiskt tal fr\u00e5n tidigare text-till-tal-modeller.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Dela generativ AI-forskning ansvarsfullt<\/strong><br>Som den f\u00f6rsta m\u00e5ngsidiga, effektiva modellen som framg\u00e5ngsrikt utf\u00f6r uppgiftsgeneralisering, tror vi att Voicebox kan inleda en ny era av generativ AI f\u00f6r tal. Liksom med andra kraftfulla nya AI-innovationer erk\u00e4nner vi att denna teknik f\u00f6r med sig potentialen f\u00f6r missbruk och oavsiktlig skada. I v\u00e5r artikel detaljerar vi hur vi byggde en mycket effektiv klassificerare som kan skilja mellan autentiskt tal och ljud genererat med Voicebox f\u00f6r att mildra dessa m\u00f6jliga framtida risker. Vi anser att det \u00e4r viktigt att vara \u00f6ppen om v\u00e5rt arbete s\u00e5 att forskningssamh\u00e4llet kan bygga vidare p\u00e5 det och f\u00f6r att forts\u00e4tta de viktiga samtal vi har om hur man bygger AI ansvarsfullt, varf\u00f6r vi delar v\u00e5rt tillv\u00e4gag\u00e5ngss\u00e4tt och resultaten i en forskningsartikel.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Voicebox representerar ett viktigt steg fram\u00e5t inom generativ AI-forskning. Andra skalbara generativa AI-modeller med uppgiftsgeneraliseringsf\u00f6rm\u00e5ga har v\u00e4ckt entusiasm om potentiella till\u00e4mpningar \u00f6ver uppgifter n\u00e4r det g\u00e4ller text, bild och videogenerering. Vi hoppas se en liknande effekt f\u00f6r tal i framtiden. Vi ser fram emot att forts\u00e4tta v\u00e5r utforskning inom ljudomr\u00e5det och se hur andra forskare bygger vidare p\u00e5 v\u00e5rt arbete.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><br><\/p>\n","protected":false},"excerpt":{"rendered":"<p>Forskare hos Meta AI har gjort ett betydande framsteg inom generativ AI f\u00f6r tal. Nu har dom skapat Voicebox, den f\u00f6rsta modellen som kan anpassa sig till uppgifter i genererat spr\u00e5k som den inte specifikt utbildades f\u00f6r att slutf\u00f6ra, med o\u00f6vertr\u00e4ffad prestanda. Fr\u00e5n Metas egen blogg: Liksom generativa system f\u00f6r bilder och text skapar Voicebox&#8230;<\/p>\n","protected":false},"author":2,"featured_media":1809,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"inline_featured_image":false,"_mi_skip_tracking":false,"_monsterinsights_sitenote_active":false,"_monsterinsights_sitenote_note":"","_monsterinsights_sitenote_category":0,"footnotes":""},"categories":[69],"tags":[],"class_list":["post-1808","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-the-good"],"aioseo_notices":[],"_links":{"self":[{"href":"https:\/\/aiguiden.com\/index.php\/wp-json\/wp\/v2\/posts\/1808","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/aiguiden.com\/index.php\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/aiguiden.com\/index.php\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/aiguiden.com\/index.php\/wp-json\/wp\/v2\/users\/2"}],"replies":[{"embeddable":true,"href":"https:\/\/aiguiden.com\/index.php\/wp-json\/wp\/v2\/comments?post=1808"}],"version-history":[{"count":1,"href":"https:\/\/aiguiden.com\/index.php\/wp-json\/wp\/v2\/posts\/1808\/revisions"}],"predecessor-version":[{"id":1810,"href":"https:\/\/aiguiden.com\/index.php\/wp-json\/wp\/v2\/posts\/1808\/revisions\/1810"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/aiguiden.com\/index.php\/wp-json\/wp\/v2\/media\/1809"}],"wp:attachment":[{"href":"https:\/\/aiguiden.com\/index.php\/wp-json\/wp\/v2\/media?parent=1808"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/aiguiden.com\/index.php\/wp-json\/wp\/v2\/categories?post=1808"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/aiguiden.com\/index.php\/wp-json\/wp\/v2\/tags?post=1808"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}