Gaan na inhoud

Meganistiese interpreteerbaarheid

in Wikipedia, die vrye ensiklopedie

Meganistiese interpreteerbaarheid (dikwels afgekort as meginterp, of MI) is 'n subveld van masjienleernavorsing, binne verklaarbare kunsmatige intelligensie wat daarop gemik is om die interne werking van neurale netwerke te verstaan deur die meganismes wat in hul berekeninge teenwoordig is, te ontleed. Die benadering poog om neurale netwerke te ontleed op 'n manier soortgelyk aan hoe binêre rekenaarprogramme omgekeerd ontwerp kan word om hul funksies te verstaan.[1]

Geskiedenis

[wysig | wysig bron]

Die term meganistiese interpreteerbaarheid is deur Chris Olah geskep.[2] Vroeë werk het verskeie tegnieke soos kenmerkvisualisering, dimensionaliteitsreduksie en attribusie gekombineer met mens-rekenaar-interaksiemetodes om modelle soos die visiemodel Inception v1 te analiseer.[3] Latere ontwikkelings sluit in die 2020-artikel Zoom In: An Introduction to Circuits, wat 'n analogie tussen neurale netwerkkomponente en biologiese neurale stroombane voorgestel het.[4] In onlangse jare het meganistiese interpreteerbaarheid prominent geword met die studie van groottaalmodelle (GTMe) en transformatorargitekture. Die veld brei vinnig uit, met verskeie toegewyde werkswinkels soos die ICML 2024 Meganistiese Interpreteerbaarheidswerkswinkel wat aangebied word.[5]

Sleutelkonsepte

[wysig | wysig bron]

Meganistiese interpreteerbaarheid poog om strukture, stroombane of algoritmes te identifiseer wat in die gewigte van masjienleermodelle geënkodeer is.[6] Dit kontrasteer met vroeëre interpreteerbaarheidsmetodes wat hoofsaaklik op invoer-uitvoer-verduidelikings gefokus het.[7] Verskeie definisies van die term bestaan, van eng tegniese definisies (die studie van oorsaaklike meganismes binne neurale netwerke) tot breër kulturele definisies wat verskeie KI-interpreteerbaarheidsnavorsings omvat.[2]

Lineêre voorstellingshipotese

[wysig | wysig bron]
Eenvoudige woordinbeddings vertoon 'n lineêre voorstelling van semantiek. Die verhouding tussen 'n land en sy hoofstad word in die voorbeeld hierbo in 'n lineêre rigting gekodeer.

Hierdie hipotese dui daarop dat hoëvlakkonsepte as lineêre rigtings in die aktiveringsruimte van neurale netwerke voorgestel word. Empiriese bewyse uit woordinbeddings en meer onlangse studies ondersteun hierdie siening, hoewel dit nie universeel geld nie.[8][9]

Superposisie

[wysig | wysig bron]

Superposisie beskryf hoe neurale netwerke baie onverwante kenmerke binne dieselfde neurone of subruimtes kan verteenwoordig, wat lei tot diggepakte en oorvleuelende kenmerkvoorstellings.[10]

Metodes

[wysig | wysig bron]

Peiling

[wysig | wysig bron]

Ondersoek behels die opleiding van eenvoudige klassifiseerders op neurale netwerkaktiverings om te toets of sekere kenmerke gekodeer is.[1]

Oorsaaklike intervensies

[wysig | wysig bron]

Meganistiese interpreteerbaarheid gebruik oorsaaklike metodes om te verstaan hoe interne modelkomponente uitsette beïnvloed, dikwels met behulp van formele gereedskap uit oorsaaklikheidsteorie.[11]

Yl ontbinding

[wysig | wysig bron]

Metodes soos yl woordeboekleer en yl outokodeerders help om komplekse oorvleuelende kenmerke te ontrafel deur interpreteerbare, yl voorstellings te leer.[12]

Toepassings en betekenis

[wysig | wysig bron]

Meganistiese interpreteerbaarheid is van kardinale belang op die gebied van KI-veiligheid om die gedrag van toenemend komplekse KI-stelsels te verstaan en te verifieer. Dit help om potensiële risiko's te identifiseer en deursigtigheid te verbeter.[13]

Verwysings

[wysig | wysig bron]
  1. 1 2 Bereska, Leonard (2024). "Mechanistic Interpretability for AI Safety -- A Review". TMLR. arXiv:2404.14082.
  2. 1 2 (2024) "Mechanistic?" in BlackboxNLP workshop..
  3. Olah, Chris; et al. (2018). "The Building Blocks of Interpretability". Distill. 3 (3). doi:10.23915/distill.00010.
  4. Olah, Chris; Cammarata, Nick; Schubert, Ludwig; Goh, Gabriel; Petrov, Michael; Carter, Shan (2020). "Zoom In: An Introduction to Circuits". Distill. 5 (3). doi:10.23915/distill.00024.001.
  5. "ICML 2024 Mechanistic Interpretability Workshop". icml2024mi.pages.dev. Besoek op 12 Mei 2025.
  6. "Towards automated circuit discovery for mechanistic interpretability". NeurIPS: 16318–16352. 2023.
  7. Kästner, Lena; Crook, Barnaby (2024). "Explaining AI through mechanistic interpretability". European Journal for Philosophy of Science. 14 (4) 52. doi:10.1007/s13194-024-00614-4.
  8. "Linguistic Regularities in Continuous Space Word Representations". NAACL: 746–751. 2013.
  9. Park, Kiho (2024). "The Linear Representation Hypothesis and the Geometry of Large Language Models". ICML. 235: 39643–39666.
  10. Elhage, Nelson; Hume, Tristan; Olsson, Catherine; Schiefer, Nicholas; Henighan, Tom; Kravec, Shauna; Hatfield-Dodds, Zac; Lasenby, Robert et al. (2022). "Toy Models of Superposition". [cs.LG].
  11. "Investigating Gender Bias in Language Models Using Causal Mediation Analysis". NeurIPS: 12388–12401. 2020. ISBN 978-1-7138-2954-6.
  12. (2024) "Sparse Autoencoders Find Highly Interpretable Features in Language Models"..
  13. Sullivan, Mark (22 April 2025). "This startup wants to reprogram the mind of AI—and just got $50 million to do it". Fast Company. Besoek op 12 Mei 2025.