Op 19 september waarschuwde Hongzoui, een onderzoeker van het China Research Institute for Europe and America, op het Taipei-seminarium dat een grote hoeveelheid eenvoudig Chinees materiaal Beijing in de wereldwijde Chinese kennisproductie een sterker interpretatievoordeel zou kunnen geven. Vier dagen geleden kondigde het Taiwan Intelligence Department aan de uitbreiding van het "Taiwan Sovereign AI Training Language Library" uit te breiden en duidelijk te maken dat het Chinese training materiaal van de huidige grote internationale taalmodellen nog steeds in het algemeen is gebaseerd op eenvoudig Chinees.

Als we deze twee dingen samenbrengen, is het probleem niet langer alleen de lettertype en lettertype die meer wordt gebruikt, maar een meer specifieke technische feit: het genereren van AI vereist een enorme hoeveelheid trainingsgegevens, terwijl de omvang, de oorsprong en de beschikbaarheid van Chinese netwerkgegevens niet gemiddeld zijn. De Taiwanese overheid investeert middelen in het aanvullen van lokale taaltypen, die zelf aangeeft dat de structurele kloof in Chinese AI-trainingsgegevens is behandeld als een beleidsprobleem.

Op 15 september kondigde het Taiwanese ministerie van Onderwijs aan dat het soevereine AI-trainingssysteem sinds de lancering eind vorig jaar meer dan 2,5 miljard woorden heeft verzameld, met als doel de taal-, cultuur- en maatschappelijke waarden van Taiwan te vergroten.

原始来源 · money.udn.com中央社/经济日报:台湾启动民间语料征集,扩充主权AI训练语料库台湾数发部称国际大型语言模型中文训练资料仍多以简体中文内容为主,并启动民间语料征集。money.udn.com ↗

Dit verklaart dat het zogenaamde “interpretatierecht” geen volledig abstracte politieke term is. Hoe een groot model antwoorden op historische, politieke, juridische en identiteitsvraagstukken met betrekking tot het materiaal dat wordt blootgesteld tijdens de training. Het model weet niet automatisch welke verhalen afkomstig zijn van vrije media, welke uit een gecensureerde persomgeving; het behandelt eerst de statistische relaties tussen een groot aantal teksten.

De digitale inhoud van het Chinese vasteland is veel groter dan die van Taiwan. Nieuwswebsites, overheidspagina's, encyclopedieën, forums, zakelijke platforms, korte video-subtitels en sociale media vormen een enorme pool van eenvoudige Chinese informatie. Maar deze pool is niet gevormd in een volledig vrije informatieomgeving. De Chinese persmedia worden politiek beheerd, online platforms worden gecensureerd, gevoelige onderwerpen worden verwijderd, beperkt of verboden, en de overheid en officiële media hebben de mogelijkheid om inhoud op grote schaal voortdurend te produceren.

Dit betekent dat er een risico moet worden geëlimineerd: als het internationale model op grote schaal gebruik maakt van openbare netwerkinformatie op het Chinese vasteland, absorbeert het niet alleen de tekstvorm van "simpel Chinees", maar kan het ook een informatieomgeving absorberen die al lang gecensureerd, verwijderd en officieel geschreven is.

Hij noemde het fenomeen “kennisongerechtigheid” tijdens een seminar over “weerstand” op 19 september en zei dat Beijing probeerde de invloed van de Chinese taal op de wereldwijde interpretatie uit te breiden met behulp van een groot aantal eenvoudige Chinese gegevens. Hij heeft ook de kwesties in het kader van het langetermijntaalbeleid en de cognitieve strijd van Taiwan besproken. Dit zijn de analyses van Hong Zhou, niet de oorzakelijke conclusies die al door een open modelaudit zijn bewezen; maar het Taiwanese ministerie van Buitenlandse Zaken heeft eerder actief de lokale soevereine taalbibliotheek uitgebreid en biedt een waarneembaar beleidsfeit: de regering van Taiwan vindt dat de bestaande Chinese training gegevens niet voldoende zijn om de Taiwanese samenleving te vertegenwoordigen.

台湾AI发展研讨活动资料图|来源:台湾数位永续协会
台湾AI发展研讨活动资料图|来源:台湾数位永续协会 · 查看图片来源 ↗
原始来源 · udn.com中央社/联合新闻网:洪子伟谈AI、简体中文语料与华语诠释权报道9月19日研讨会中关于认知战、语言政策和中文AI语料的讨论。udn.com ↗

Wat echt moet worden onderscheiden, is de afstand tussen "dataschaalvoordeel" en "politieke manipulatie". Een hoger percentage van het Chinese materiaal in het algemeen, en kan niet alleen bewijzen dat een model rechtstreeks wordt gecontroleerd door Beijing; op dezelfde manier, een model met behulp van het Chinese in het algemeen antwoorden, noch vertegenwoordigen de bronnen van kennis uit Taiwan. De regionale samenstelling van de trainingsgegevens, het gewicht van de bron, de latere finishing en veiligheidsregels beïnvloeden de uitvoer, terwijl de meeste zakelijke modellen deze informatie niet volledig openbaar maken.

Een lezer die in het verleden de People's Daily, Xinhua of Taiwan media leest, kent tenminste de bron van het artikel; wanneer hij wordt geconfronteerd met een chatbot, wordt het antwoord vaak gecomprimeerd in een tekst zonder duidelijke oorsprong. Gebruikers zien een schijnbaar verenigd antwoord, maar het is moeilijk om te weten van welk trainingsmateriaal een bepaalde historische benaming, politiek concept of de uitdrukking van een tweetal onderwerpen komt.

Voor Peking heeft deze structuur potentiële voordelen en hoeft het niet elke keer te worden gerealiseerd door middel van een direct-manipulatiemodel. Het Chinese vasteland heeft een grotere productie van Chinese inhoud, maar kan ook door middel van een censuurstelsel bepalen welke politieke verhalen op lange termijn in het openbaar netwerk kunnen blijven. Als deze openbare informatie in grote hoeveelheden in een trainingsset komt, kan informatiefiltering die oorspronkelijk in China plaatsvond, invloed hebben op het buitenland via technische kanalen.

Dit is anders dan traditionele publiciteit. Traditionele publiciteit vereist dat kranten, tv-zenders, websites of sociale accounts de inhoud naar het buitenland verzenden; de impact van trainingsgegevens komt eerder voor – voordat gebruikers vragen stellen, is het model voltooid met het leren van grote hoeveelheden tekst. Of het uiteindelijk een systeemverschil vormt, vereist specifieke modeltests om te beoordelen, maar de voorwaarden voor de vorming van risico's zijn al aanwezig: onevenwichtige gegevensomvang, ondoorzichtige bronnen en verschillen in de hoeveelheid informatie die de verschillende Chinese samenlevingen aan de modellen kunnen bieden.

De huidige reactie van Taiwan is niet alleen om de Chinese taal te blokkeren, maar om zijn eigen aanbod van informatie te vergroten. Het ministerie van Buitenlandse Zaken nodigt de uitgevers, e-bookplatforms en makers uit om inhoud te autoriseren in de trainingsspraakboek, in wezen in de strijd om de eigen historische ervaring, juridische systemen, culturele en taalkundige gewoontes van Taiwan in het AI-trainingssysteem te brengen. Dit is niet precies hetzelfde als de taalkundige politiek die Hongzhi pleit, maar wijst op dezelfde realiteit

  • de Chinese kenniswedstrijd van de toekomst zal steeds meer plaatsvinden in datasets en modellen, en niet alleen op de media-platform.

Vanuit het perspectief van de "rode muur" moet de focus van dit onderwerp ook niet worden gestopt op "beijing of er geen propaganda is". een diepere laag, is dat de informatie-controle in China in het tijdperk van AI een nieuw verspreidingspad kan krijgen: een netwerkomgeving die is gevormd door langdurige censuur, kan worden geabsorbeerd als originele gegevens door wereldwijde technologiebedrijven, en dan in de vorm van geen duidelijke media-label terug naar buitenlandse gebruikers.

Deze invloedsketen vereist ook meer openbare modellenaudits en gegevensonderzoek om nauwkeurig te meten, maar het heeft het probleem zelf veranderd. In het verleden werd er gesproken over informatiebeheersing in China, waarbij de kern was van wat te verwijderen en wie te vergrendelen; in het tijdperk van gecreëerde AI, moest ook nog een ander ding worden gevolgd

  • de taal en verhalen van degenen die gemakkelijker zijn om de "Chinese wereld" te worden die door de standaardmodellen bekend is, na een grote hoeveelheid inhoud achtergelaten, herhaald en machine learning.
MEMBER DISCUSSION

Artikelbespreking

Geverifieerde leden kunnen openbaar over dit bericht discussiëren en hun eigen inhoud beheren.