Die 38 Zeugen, die es nie gab: Der Bystander-Effekt zwischen Laborbefund und Videoevidenz
🎧 Listen to this article
Psychologie · 2026-09-29
Vollständig KI-generierter Artikel (ohne Vorabprüfung).
Der Aufhänger: Eine Schlagzeile, die eine Disziplin prägte
Am 27. März 1964 erschien in der New York Times ein Artikel von Martin Gansberg unter der Überschrift „37 Who Saw Murder Didn't Call the Police". Er berichtete vom Mord an Catherine „Kitty" Genovese, einer 28-jährigen Barmanagerin, die zwei Wochen zuvor vor ihrem Wohnhaus in Kew Gardens, Queens, von Winston Moseley angegriffen und getötet worden war. Die Kernaussage des Textes war nicht der Mord. Die Kernaussage war das Publikum: Dutzende Nachbarn hätten über eine halbe Stunde hinweg zugesehen, und niemand habe die Polizei gerufen.
Der Text wurde zu einem der folgenreichsten Zeitungsartikel der Sozialwissenschaften. A. M. Rosenthal, damals Metropolredakteur der Zeitung, machte ein Buch daraus – Thirty-Eight Witnesses. Zwei junge Sozialpsychologen, John Darley und Bibb Latané, lasen die Geschichte, fanden die gängige Erklärung („Großstadtapathie", „Entfremdung") unbefriedigend und stellten eine andere Frage: Was, wenn nicht die Gleichgültigkeit der Einzelnen das Problem ist, sondern ihre Anzahl? Vier Jahre später hatten sie eine Antwort, die seither in praktisch jedem Einführungslehrbuch der Psychologie steht.
Und dann geschah etwas, das diesen Fall für jeden interessant macht, der wissen will, wie Erkenntnis entsteht und wie sie sich korrigiert: Nahezu jedes Element der Ausgangsgeschichte erwies sich als falsch. Die Zahl der Zeugen war erfunden, das Ausmaß dessen, was sie sahen, war übertrieben, und es wurde sehr wohl eingegriffen. Die Zeitung selbst bezeichnete ihre eigene Berichterstattung 2016 als fehlerhaft und räumte ein, sie habe die Zahl der Zeugen und das, was diese wahrgenommen hatten, grob übertrieben.
Die naheliegende Schlussfolgerung wäre: Der Mythos ist widerlegt, also ist der Effekt widerlegt. Diese Schlussfolgerung ist falsch, und zwar auf eine lehrreiche Weise. Der Bystander-Effekt ist einer der am besten replizierten Befunde der Sozialpsychologie – über 100 unabhängige Effektstärken, gemessen über fünf Jahrzehnte, mit einem klaren mittleren Effekt. Gleichzeitig zeigen Auswertungen echter Überwachungsvideos aus drei Ländern, dass in neun von zehn öffentlichen Konflikten mindestens ein Anwesender eingreift – und dass mehr Umstehende die Chance auf Hilfe nicht senken, sondern leicht erhöhen.
Beide Befunde sind solide. Beide sind reproduziert. Und sie widersprechen einander nicht. Dass das so ist, erkennt man erst, wenn man sehr genau hinsieht, was eigentlich gemessen wurde. Dieser Artikel rekonstruiert den Fall, den Befund, den Gegenbefund – und die Algebra, die beide versöhnt. Am Ende steht eine praktische Konsequenz, die jeder kennt, der schon einmal einen Alarm in einen Gruppenkanal statt an eine Person geschickt hat.
Teil 1: Was 1964 wirklich geschah
Die Geschichte, wie sie erzählt wurde
Die kanonische Fassung geht so: 38 Menschen beobachteten aus ihren Fenstern einen 35 Minuten dauernden Angriff in drei Phasen. Sie sahen die Messerstiche. Sie hörten die Schreie. Keiner rief die Polizei. Keiner ging hinunter.
Diese Fassung hat enorme erzählerische Kraft, weil sie ein moralisches Rätsel aufwirft, das sich nicht durch Bösartigkeit erklären lässt. 38 böse Menschen in einem Wohnblock sind unwahrscheinlich. 38 normale Menschen, die etwas Monströses tun, sind ein Problem, das nach einer strukturellen Erklärung verlangt.
Was die Prozessakten zeigen
Richard Manning, Mark Levine und Alan Collins haben 2007 im American Psychologist die Grundlagen der Geschichte anhand der Gerichtsakten des Verfahrens gegen Moseley geprüft. Ihr Befund zerlegt die Erzählung in drei Punkte.
Erstens: die Zahl. Im Prozess sagten fünf Bewohner des Hauses aus; nur drei waren Augenzeugen, die Genovese und ihren Angreifer gemeinsam sahen. Der zuständige stellvertretende Bezirksstaatsanwalt gab später zu Protokoll, man habe etwa ein halbes Dutzend Personen gefunden, die wahrnahmen, was vor sich ging. Dass mehr Menschen Schreie hörten, ist unbestritten – aber Hören ist nicht Sehen, und ein nächtlicher Schrei in einem Stadtviertel mit einer Kneipe an der Ecke war 1964 ein mehrdeutiges Signal.
Zweitens: was sie sahen. Die Aussagen der drei Augenzeugen beschreiben unspezifische Szenen. Einer sah ein Paar nah beieinanderstehen und nicht kämpfen. Ein anderer, Robert Mozer, sah eine Frau am Boden knien. Keiner der Zeugen berichtete, die Messerstiche gesehen zu haben – und das ist keine Schutzbehauptung, sondern Geometrie: Nach dem ersten Angriff ging Genovese um die Gebäudeecke, aus dem Blickfeld der Fenster heraus. Der zweite, tödliche Angriff fand in einem Hausflur statt, den von den Wohnungen aus niemand einsehen konnte.
Drittens: das Nichtstun. Es wurde eingegriffen. Robert Mozer rief aus dem Fenster und verscheuchte den Angreifer – deshalb überhaupt die zeitliche Unterbrechung, die die Geschichte erst dramatisch macht. Und Sophia Farrar, eine Nachbarin, lief, nachdem ein anderer Anwohner sie angerufen hatte, in den Hausflur und hielt die sterbende Genovese im Arm, ohne zu wissen, ob der Täter noch da war. Wer eine unbewaffnete Frau sucht, die in eine Situation hineingeht, deren Gefahr sie nicht einschätzen kann, findet sie in dieser Geschichte – sie kam nur in der Schlagzeile nicht vor.
Über die Polizeianrufe gibt es bis heute widersprüchliche Angaben. Plausibel ist, dass mindestens einer erfolgte; erschwerend kam hinzu, dass es 1964 in New York noch keine einheitliche Notrufnummer gab.
Warum der Mythos trotzdem produktiv war
Manning, Levine und Collins argumentieren weiter, und dieser Teil ist der interessantere: Die Parabel habe nicht nur ein falsches Bild vermittelt, sie habe die Forschungsagenda verengt. Sie etablierte ein bestimmtes Bild des Kollektivs – nämlich das der Gruppe als Instanz, die dem Einzelnen Untätigkeit aufzwingt. Damit verdrängte sie die ältere Forschungstradition, die Gruppen vor allem als handlungs- und gewaltgeneigt betrachtete, und sie verstellte für Jahrzehnte den Blick auf die naheliegende Gegenfrage: Unter welchen Bedingungen befördern Gruppen das Eingreifen?
Genau diese Frage wurde erst gestellt, als Videomaterial verfügbar wurde. Und sie lieferte die Befunde aus Teil 4.
Es lohnt sich, hier einen Moment innezuhalten. Die Geschichte der 38 Zeugen ist ein Musterfall dafür, wie eine eingängige Erzählung die Rolle eines Datenpunkts übernimmt – dieselbe Mechanik, die in Die erfundene Erinnerung: Warum unser Gedächtnis keine Aufnahme ist – und wie Elizabeth Loftus zeigte, dass man sich an Dinge erinnern kann, die nie geschahen auf der Ebene des individuellen Gedächtnisses beschrieben wird. Eine Disziplin kann eine falsche Erinnerung haben.
Teil 2: Der Laborbefund
Das Krampfanfall-Experiment
Darley und Latané veröffentlichten 1968 im Journal of Personality and Social Psychology das Experiment, das dem Effekt seinen Namen gab. Der Aufbau war so gewählt, dass er die vermutete Ursache isolierte und alles andere ausschloss.
Studierende nahmen an einer angeblichen Gruppendiskussion über Probleme des Universitätslebens teil. Um Befangenheit zu vermeiden, säße – so die Erklärung – jeder Teilnehmende allein in einer Kabine; die Verständigung laufe über Gegensprechanlagen, jeweils zwei Minuten pro Person, in fester Reihenfolge, ohne anwesenden Versuchsleiter. Tatsächlich war der einzige echte Teilnehmende die Versuchsperson; alle anderen Stimmen kamen vom Band.
Beim zweiten Durchgang geriet eine der Stimmen in Not: stockende Sprache, dann die unmissverständliche Schilderung eines beginnenden epileptischen Anfalls, dann Ersticken, dann Stille. Gemessen wurde, ob und wie schnell die Versuchsperson die Kabine verließ, um Hilfe zu holen.
Die einzige experimentell variierte Größe war, wie viele weitere Teilnehmende die Versuchsperson zu hören glaubte:
| Wahrgenommene Gruppengröße | Anteil, der eingriff | Charakteristik der Reaktionszeit |
|---|---|---|
| 2 Personen (nur Opfer und Versuchsperson) | 85 % | schnell, im Mittel rund eine Minute |
| 3 Personen | 62 % | verzögert |
| 6 Personen | 31 % | stark verzögert, im Mittel deutlich über zwei Minuten |
Der Befund ist aus zwei Gründen stark. Erstens ist die unabhängige Variable nur die geglaubte Anwesenheit anderer – niemand sah ein passives Gegenüber, das ihn hätte anstecken können. Zweitens geht die Hilfe nicht nur in der Häufigkeit zurück, sondern auch in der Geschwindigkeit, und beides variiert monoton mit der Gruppengröße. Das ist ein Dosis-Wirkungs-Muster, kein Zufallsbefund.
Ein Detail, das in Lehrbuchzusammenfassungen meist verlorengeht, verdient Beachtung: Die Nichthelfenden wirkten in der Nachbefragung nicht gleichgültig, sondern aufgewühlt. Sie hatten nicht entschieden, nicht zu helfen. Sie steckten in einem Konflikt und kamen nicht heraus. Diese Beobachtung wird in Teil 5 wichtig.
Der Raum, der sich mit Rauch füllte
Im selben Jahr veröffentlichten Latané und Darley eine zweite Studie mit anderem Mechanismus. Teilnehmende füllten in einem Warteraum einen Fragebogen aus, während durch eine Wandöffnung weißer Rauch einströmte – bis zu vier Minuten lang, am Ende so dicht, dass die Sicht eingeschränkt war.
Allein im Raum meldeten 75 Prozent den Rauch innerhalb der ersten zwei Minuten. Saßen zwei instruierte Mitarbeiter dabei, die den Rauch demonstrativ ignorierten, meldeten nur 10 Prozent. In Dreiergruppen echter, ununterrichteter Versuchspersonen produzierten lediglich 38 Prozent der Gruppen überhaupt einen Melder.
Hier wirkt nicht die Verantwortungsdiffusion, sondern ein zweiter Mechanismus: pluralistische Ignoranz. Die Situation ist mehrdeutig. Jeder sucht bei den anderen nach einer Deutung. Alle anderen tun in diesem Moment dasselbe – sie schauen unauffällig und bleiben ruhig, um sich nicht zu blamieren. Das Ergebnis ist eine Gruppe von Menschen, die sich wechselseitig durch ihre Fassade beruhigen. Jeder Einzelne ist beunruhigt, und jeder Einzelne hält sich für den Einzigen, der beunruhigt ist.
Ein Jahr später zeigten Latané und Judith Rodin mit dem „Lady in Distress"-Aufbau – eine Versuchsleiterin stürzt im Nebenraum hörbar von einem Stuhl – eine Variante, die das Bild vervollständigt: Allein halfen rund 70 Prozent, in Anwesenheit eines passiven Fremden 7 Prozent, bei zwei einander fremden Versuchspersonen griff in 40 Prozent der Paare mindestens eine ein – bei befreundeten Paaren wieder rund 70 Prozent. Freunde lesen einander besser und fürchten die Blamage voreinander weniger. Die Hemmung ist also nicht an die bloße Anwesenheit von Körpern gebunden, sondern an die soziale Beziehung zwischen ihnen.
Die drei Mechanismen
Aus dieser Serie entstand das bis heute gültige Erklärungsgerüst. Es sind drei getrennte Prozesse, die zufällig in dieselbe Richtung wirken:
- Diffusion der Verantwortung. Die wahrgenommene persönliche Pflicht zu handeln wird auf alle Anwesenden verteilt. Bei sechs Personen fühlt sich jeder für ein Sechstel zuständig. Dieser Mechanismus wirkt auch dann, wenn man die anderen gar nicht sieht – deshalb funktionierte das Kabinen-Experiment.
- Pluralistische Ignoranz. Die Lage ist mehrdeutig, und die Ruhe der anderen wird als Evidenz gelesen, dass nichts los ist. Dieser Mechanismus braucht Sichtkontakt und verschwindet, sobald die Lage eindeutig ist.
- Bewertungsangst (evaluation apprehension). Eingreifen heißt, vor Publikum zu handeln und sich möglicherweise zu blamieren – falscher Alarm, ungeschickte erste Hilfe, ein Streit, der sich als Paarkonflikt entpuppt. Dieser Mechanismus kann die Hilfe auch erhöhen, wenn die Norm des Eingreifens klar und das Publikum entsprechend eingestellt ist.
Bibb Latané und Steve Nida zogen 1981 im Psychological Bulletin nach zehn Jahren Forschung eine bemerkenswert eindeutige Bilanz: Der Gruppengrößeneffekt sei einer der robustesten Befunde des Feldes. Für den Rest des 20. Jahrhunderts galt die Sache als erledigt.
Teil 3: Wie stark ist der Effekt wirklich?
Die Meta-Analyse von 2011
Peter Fischer und Kollegen legten 2011 im Psychological Bulletin die umfassendste quantitative Zusammenfassung vor: 105 unabhängige Effektstärken aus Studien von 1960 bis 2010, zusammen über 7.700 Versuchspersonen. Das Gesamtergebnis: g = −0,35.
Diese Zahl ist zuerst einmal eine Bestätigung. Ein mittlerer negativer Effekt über fünf Jahrzehnte, Labore, Länder und Paradigmen hinweg ist in der Sozialpsychologie ein starkes Ergebnis – besonders in einer Disziplin, in der die Replikationskrise seit den 2010er Jahren zahlreiche Lehrbuchbefunde relativiert hat, wie es in Das Marshmallow-Versprechen: Warum ein Süßigkeitentest über ein halbes Jahrhundert die Willenskraft neu definierte – und dann selbst auf die Probe gestellt wurde und Der Gipfel der Ahnungslosigkeit: Warum der berühmteste Effekt der Psychologie vielleicht nur ein statistisches Trugbild ist nachzulesen ist. Der Bystander-Effekt gehört nicht in diese Kategorie. Er ist real.
Aber er ist auch: mittelgroß, nicht überwältigend. Und vor allem ist er stark bedingt. Die Moderatorenanalyse ist der eigentlich wertvolle Teil der Arbeit, weil sie sagt, wann der Effekt klein wird oder verschwindet. Die Hemmung war deutlich reduziert, wenn
- die Situation als gefährlich wahrgenommen wurde statt als harmlos,
- ein Täter anwesend war statt eines bloßen Unglücks,
- die Hilfe körperlichen Einsatz erforderte statt nur eines Hinweises,
- die Umstehenden ausschließlich männlich waren,
- die anderen Anwesenden naive Mitbetroffene statt instruierter passiver Mitarbeiter waren,
- die anderen nur virtuell präsent waren statt körperlich anwesend,
- man sich kannte statt einander fremd zu sein.
Fischer und Kollegen erklären das mit dem Arousal-Cost-Reward-Modell: Eine eindeutig gefährliche Lage wird schneller und sicherer als echter Notfall erkannt, erzeugt höhere Erregung und damit mehr Hilfe. Zugleich liefert die Anwesenheit anderer in gefährlichen Lagen einen Nutzen, den sie in harmlosen nicht hat – zu zweit gegen einen Angreifer vorzugehen ist objektiv weniger riskant als allein.
Die entscheidende Einschränkung
Damit steht die klassische Formulierung des Effekts schief. Sie lautete in der populären Fassung: Je mehr Zuschauer, desto unwahrscheinlicher wird geholfen. Die Meta-Analyse sagt genauer: Je mehr Zuschauer, desto unwahrscheinlicher hilft ein bestimmter Einzelner – und dieser Zusammenhang schwächt sich ab oder kehrt sich um, je eindeutiger und gefährlicher die Lage ist.
Das ist nicht dieselbe Aussage, und der Unterschied zwischen „ein bestimmter Einzelner" und „irgendjemand" ist der Kern des nächsten Kapitels. Vorher aber braucht es Daten aus der Wirklichkeit. Denn fast alles, was bis hierher zitiert wurde, stammt aus inszenierten Situationen – aus gutem Grund, aber mit einer offensichtlichen Frage im Rücken: Verhalten sich Menschen in einem echten Straßenkonflikt so wie Studierende in einer Kabine?
Teil 4: Die Videoevidenz
219 echte Konflikte
2020 veröffentlichten Richard Philpot, Lasse Suonperä Liebst, Mark Levine, Wim Bernasco und Marie Rosenkrantz Lindegaard im American Psychologist eine Arbeit, die den methodischen Engpass des Feldes umging. Statt Notfälle zu inszenieren, werteten sie Aufnahmen echter Notfälle aus: 219 Videoclips öffentlicher Konflikte aus den Überwachungskamerasystemen dreier Innenstädte – Amsterdam (63), Lancaster (95) und Kapstadt (61).
Die Wahl der Städte ist kein Zufall. Sie unterscheiden sich erheblich im Gewaltniveau und im subjektiven Sicherheitsgefühl; Kapstadt gilt als deutlich unsicherer als Lancaster. Wenn Eingreifen eine Funktion von wahrgenommener Sicherheit wäre, müsste sich das zeigen.
Die Ergebnisse:
| Befund | Wert |
|---|---|
| Konflikte mit mindestens einem eingreifenden Anwesenden | 90,9 % |
| Durchschnittliche Zahl der Eingreifenden pro Vorfall | 3,76 (SD = 3,01) |
| Effekt jedes zusätzlichen Anwesenden auf die Hilfechance | OR = 1,10 (p = 0,008) |
| Unterschiede zwischen den drei Städten | nicht signifikant |
In neun von zehn Fällen tat mindestens eine anwesende Person etwas – dazwischengehen, die Streitenden trennen, den Angreifer festhalten, das Opfer wegziehen, beruhigend einwirken. Und die Zahl der Umstehenden senkte die Chance auf Hilfe nicht, sie erhöhte sie leicht. Der Befund war über drei sehr unterschiedliche städtische Kontexte hinweg stabil.
Die Rolle der Gefahr
Zwei Jahre später schoben Lindegaard, Liebst, Philpot, Levine und Bernasco in Social Psychological and Personality Science die naheliegende Anschlussfrage nach: Hängt das Eingreifen vom Gefahrengrad ab? Sie kodierten 80 zwischenmenschliche Konflikte aus denselben drei Städten (Amsterdam 26, Lancaster 30, Kapstadt 24; Zahl der Umstehenden von 1 bis 62, Median 15) in drei Aggressionsstufen: aufdringliche, aber nicht gewalttätige Handlungen (Zeigen, leichtes Schubsen); körperliche Aggression (Schläge, Tritte, Stöße); Waffeneinsatz oder Gewalt gegen eine bereits am Boden liegende Person.
Der Befund hat zwei Hälften. Die Chance auf ein Eingreifen war rund 19-mal höher, sobald überhaupt gezielte Aggression sichtbar wurde. Eine weitere Steigerung der Gefahr – von Stufe 1 auf 2 auf 3 – änderte die Eingreifwahrscheinlichkeit dagegen nicht signifikant.
Das ist ein Schwelleneffekt, kein Gradient. Menschen greifen nicht proportional zur Gefahr ein, sondern sobald eine Situation die Grenze von „unklar" zu „eindeutig ein Übergriff" überschreitet. Und genau das ist die empirische Bestätigung des Mechanismus, den Latanés Rauchversuch vor über fünfzig Jahren nahegelegt hatte: Die entscheidende Variable ist nicht Mut, sondern Eindeutigkeit.
Was diese Studien nicht zeigen
Ehrlichkeit gebietet drei Einschränkungen. Erstens: Überwachungskameras stehen an belebten Innenstadtorten – Kneipenviertel, Plätze, Bahnhofsvorfelder. Das ist ein spezifischer Ausschnitt der Wirklichkeit, kein Querschnitt. Ein nächtlicher Hinterhof gehört nicht dazu.
Zweitens: Gemessen wurde auf Ereignisebene („griff irgendjemand ein?"), nicht auf Individualebene („griff diese bestimmte Person ein?"). Bei 15 Umstehenden im Median und 3,76 Eingreifenden im Mittel bleibt die große Mehrheit der Anwesenden passiv. Aus „es wurde geholfen" folgt nicht „die meisten halfen".
Drittens: Was als Eingreifen zählte, war bewusst breit definiert. Beruhigendes Zureden ist etwas anderes, als sich zwischen ein Messer und ein Opfer zu stellen. Die Studien sagen, dass Nichtstun nicht die Norm ist. Sie sagen nichts darüber, ob die Hilfe wirksam war.
Teil 5: Warum beide recht haben – die Algebra dahinter
Zwei Fragen, die wie eine klingen
Der scheinbare Widerspruch zwischen Labor und Video löst sich vollständig auf, sobald man zwei Größen trennt, die die Umgangssprache zusammenwirft:
- p – die Wahrscheinlichkeit, dass ein bestimmter Anwesender eingreift.
- P – die Wahrscheinlichkeit, dass mindestens einer der Anwesenden eingreift.
Wenn die Entscheidungen unabhängig wären, gälte
$$P = 1 - (1 - p)^n$$
mit n als Zahl der Anwesenden. Der Bystander-Effekt ist eine Aussage über p. Die Videostudien messen P. Und p kann mit n fallen, während P trotzdem steigt – solange p langsamer fällt als 1/n.
Ein Zahlenbeispiel macht das greifbar. Angenommen, eine einzelne anwesende Person greift allein mit 60 Prozent Wahrscheinlichkeit ein, und diese individuelle Bereitschaft sinkt mit wachsender Gruppe deutlich ab:
| Anwesende n | individuelle Bereitschaft p | Chance auf Hilfe \(P = 1-(1-p)^n\) |
|---|---|---|
| 1 | 0,60 | 60,0 % |
| 2 | 0,45 | 69,8 % |
| 5 | 0,30 | 83,2 % |
| 10 | 0,22 | 91,7 % |
| 20 | 0,15 | 96,1 % |
Die individuelle Bereitschaft ist von 60 auf 15 Prozent eingebrochen – ein dramatischer Bystander-Effekt. Und trotzdem steigt die Chance, dass geholfen wird, von 60 auf 96 Prozent. Beide Sätze beschreiben dieselbe Tabelle: „Jeder Einzelne wird deutlich passiver" und „Es wird viel wahrscheinlicher geholfen".
Wer das Muster wiedererkennt, hat recht: Es ist exakt dieselbe Algebra, die in Der lange Schwanz der Latenz: Tail Latency und warum Mittelwerte in der Cloud lügen beschreibt, warum bei 100 Teilanfragen mit je 1 Prozent Ausreißerrate 63 Prozent der Nutzeranfragen langsam werden. Dort ist der Fan-out das Problem, hier ist er die Rettung – die Formel ist dieselbe, nur das Vorzeichen des Wunsches ist umgekehrt.
Damit ist auch das Ergebnis OR = 1,10 pro zusätzlichem Anwesenden bei Philpot et al. interpretierbar. Es ist genau das, was diese Algebra vorhersagt, wenn p moderat sinkt – oder wenn in einem öffentlichen, eindeutig aggressiven Konflikt das Hemmungsmoment ohnehin schwach ist, wie Fischers Moderatoren nahelegen.
Die zweite Auflösung: Reflex vor Entscheidung
Es gibt eine zweite, unabhängige Auflösung. Ruud Hortensius und Beatrice de Gelder haben 2018 in Current Directions in Psychological Science vorgeschlagen, den Bystander-Effekt nicht als Ergebnis einer Abwägung zu verstehen, sondern als Ergebnis eines reflexiven Handlungssystems.
Ihre Ausgangsbeobachtung ist die aus Teil 2: Nichthelfende sind nicht gleichgültig, sondern erregt. Das passt schlecht zu einem Modell, in dem jemand die Verantwortung rational durch sechs teilt. Es passt gut zu einem Modell mit zwei gegenläufigen motivationalen Systemen:
- System I – persönliche Bedrängnis (personal distress): eine sofortige, selbstbezogene Reaktion, die Erstarren, Flucht oder Kampf vorbereitet. Sie wird durch die Anwesenheit anderer verstärkt.
- System II – Mitgefühl (sympathy): eine langsamere, auf den anderen gerichtete Reaktion, die Hilfe trägt.
Ob geholfen wird, ist die Resultante beider Systeme, moduliert durch Persönlichkeitsmerkmale. Bildgebende Befunde stützen das: In einer fMRT-Studie der Autoren sank mit wachsender Zahl von Umstehenden die Aktivität genau in den Regionen, die für die Vorbereitung einer Hilfehandlung relevant sind – prä- und postzentraler Gyrus sowie medialer präfrontaler Cortex. Nicht die Entscheidung wird anders getroffen; die Handlungsvorbereitung wird gedämpft, bevor eine Entscheidung überhaupt ansteht.
Ich bin der Meinung, dass dieses Modell auch erklärt, warum Appelle an Moral so wenig ausrichten und Training so viel: Man kann einen Reflex nicht durch Überzeugung ändern, aber man kann ihn durch Wiederholung umbauen. Diese Deutung geht über die Befundlage hinaus und ist als Interpretation zu lesen, nicht als Ergebnis.
Teil 6: Der digitale Schauplatz
Die Frage, wie sich all das in Online-Umgebungen verhält, ist praktisch relevant – für Community-Moderation, für Meldemechanismen, für interne Kommunikationsplattformen.
Fischers Meta-Analyse enthielt dazu bereits einen Hinweis: Der Hemmungseffekt war schwächer, wenn die anderen nur virtuell präsent waren. Das leuchtet ein, weil zwei der drei Mechanismen an Kopräsenz hängen. Pluralistische Ignoranz braucht die beobachtbare Ruhe der anderen; Bewertungsangst braucht ein Publikum, das die eigene Blamage mitbekommt. In einem Chat, in dem 400 Personen Mitglied sind, aber niemand sichtbar zusieht, bleibt vor allem die Verantwortungsdiffusion übrig – und die ist der Mechanismus, der die Anwesenheit anderer nur glauben muss.
Franccesca Kazerooni, Samuel Hardman Taylor, Natalya Bazarova und Janis Whitlock haben 2018 im Journal of Computer-Mediated Communication eine Variable untersucht, die es offline so nicht gibt: nicht die Zahl der Zuschauer, sondern die Zahl der Angreifer, und die Frage, ob ein Angriff original oder geteilt ist. Ihr Befund: Vier Angreifer mit eigenen Beiträgen erhöhten die wahrgenommene Verletzung, die Einordnung als Cybermobbing und die Bereitschaft zum Eingreifen gegenüber einem einzelnen Angreifer deutlich. War derselbe Inhalt dagegen geteilt statt original verfasst, sank die Eingreifbereitschaft spürbar.
Das ist konsistent mit dem Eindeutigkeits-Befund aus Teil 4: Vier unabhängige Angriffe machen aus einem mehrdeutigen Vorfall eine erkennbare Attacke. Und es ergänzt ihn um eine unangenehme digitale Eigenheit: Das Teilen scheint nicht nur die Verantwortung der Zuschauer zu verdünnen, sondern auch die des Angreifers – und mit ihr die Bereitschaft der Umstehenden, überhaupt etwas als Übergriff zu behandeln.
Teil 7: Das übergeordnete Denkprinzip
Tritt man einen Schritt zurück, erzählt dieser Fall zwei Geschichten übereinander.
Die erste ist eine über wissenschaftliche Selbstkorrektur, und sie verläuft nicht so, wie das Klischee es will. Die Ausgangsgeschichte war weitgehend falsch. Der Befund, den sie ausgelöst hat, ist weitgehend richtig. Die populäre Formulierung dieses Befundes war zu grob. Die Korrektur dieser Formulierung kam nicht aus einem gescheiterten Replikationsversuch, sondern aus einer neuen Datenquelle, die eine alte Frage endlich auf der richtigen Ebene stellen konnte. Wer aus der Tatsache, dass die Genovese-Geschichte ein Mythos ist, folgert, der Bystander-Effekt sei ein Mythos, macht denselben Fehler in die Gegenrichtung: Er lässt die Erzählung wieder für die Evidenz einstehen.
Die zweite Geschichte ist eine über Messebenen. Fast jeder scheinbare Widerspruch zwischen zwei soliden Befunden ist in Wahrheit eine Verwechslung der Bezugseinheit. Individuum oder Ereignis. Anfrage oder Teilanfrage. Nutzer oder Sitzung. Commit oder Release. Die Frage „Wovon genau ist das eine Rate?" löst mehr Debatten auf, als jede zusätzliche Studie es könnte.
Erkenntnis zum Mitnehmen
Die praktische Lehre lautet: Der Bystander-Effekt ist kein Charakterdefizit, sondern ein Adressierungsproblem – und man behebt ihn nicht durch Appelle, sondern indem man Mehrdeutigkeit beseitigt und Verantwortung namentlich zuweist.
Beide Hebel folgen direkt aus der Evidenz. Eindeutigkeit, weil die Chance auf Eingreifen um den Faktor 19 springt, sobald ein Vorfall als solcher erkennbar wird – aber danach nicht weiter steigt. Namentliche Zuweisung, weil die Verantwortungsdiffusion der einzige der drei Mechanismen ist, der auch ohne Sichtkontakt funktioniert und deshalb der einzige, der in verteilten und digitalen Umgebungen ungebremst weiterläuft.
Vier konkrete Schritte, die sich daraus ableiten lassen:
- Im Ernstfall als Betroffener: Einzelne ansprechen. Nicht „Hilfe!", sondern „Sie da, in der blauen Jacke – rufen Sie den Notruf." Das setzt n für diese Person auf 1. Gleiches gilt, wenn man selbst als Ersthelfender eintrifft und ein Publikum vorfindet: Aufgaben mit Blickkontakt und Beschreibung vergeben, nicht in die Menge rufen.
- Im Ernstfall als Umstehender: den Anfang machen. Der erste Eingriff verändert die Lage für alle anderen doppelt – er beseitigt die Mehrdeutigkeit und setzt eine sichtbare Norm. Die 3,76 Eingreifenden pro Vorfall aus den Videodaten sind fast nie 3,76 unabhängige Entscheidungen; sie sind eine Kaskade.
- In Organisationen: kein Alarm ohne Namen. Ein Fehlerbericht in einem Kanal mit 200 Mitgliedern ist der Rauchversuch mit Teilnehmerliste. Eine Eskalation braucht eine benannte Person mit Zeitfenster – und eine Regel, was passiert, wenn die nicht reagiert. Dass verteilte Systeme genau dieses Problem – wer stellt fest, dass jemand ausgefallen ist, und wer handelt dann – explizit lösen müssen, ist in Das Flüstern der Maschinen: Gossip-Protokolle, SWIM und wie ein Cluster erfährt, wer noch lebt beschrieben. Menschen bekommen diese Explizitheit selten geschenkt.
- Im Code-Review und in der Qualitätssicherung: Zuständigkeit vor Publikum. „Alle schauen mal drüber" erzeugt zuverlässig weniger Aufmerksamkeit als zwei namentlich zugewiesene Reviewer. Das ist keine Metapher, sondern dieselbe Mechanik in einer Umgebung, in der die Kosten des Nichthinsehens nur später anfallen.
Eine Frage zum Nachdenken
Die Videodaten sagen, dass in neun von zehn öffentlichen Konflikten geholfen wird, und die Laborbefunde sagen, dass jeder Einzelne in der Menge deutlich passiver wird. Beides stimmt, weil genug Menschen anwesend sind, dass die wenigen Bereiten reichen. Die Statistik trägt das Ergebnis, nicht die Haltung der Einzelnen.
Daraus folgt eine unbequeme Frage: Unsere Systeme – Notfallketten, Meldewege, Bereitschaftsdienste, Review-Prozesse – funktionieren oft nicht, weil ihre Verantwortlichkeiten sauber geregelt wären, sondern weil genug Leute dranhängen, dass sich statistisch fast immer jemand findet. Welche dieser Ketten in deinem Umfeld würde noch halten, wenn nur drei statt fünfzehn Leute zuschauen – und woher weißt du das, ohne es ausprobiert zu haben?
Querverweise im Vault
- Die erfundene Erinnerung: Warum unser Gedächtnis keine Aufnahme ist – und wie Elizabeth Loftus zeigte, dass man sich an Dinge erinnern kann, die nie geschahen – dieselbe Mechanik eine Ebene tiefer: Wie eine eingängige Erzählung die Stelle einer Beobachtung einnimmt, im Kopf wie in einer Disziplin.
- Der Gipfel der Ahnungslosigkeit: Warum der berühmteste Effekt der Psychologie vielleicht nur ein statistisches Trugbild ist – der Kontrastfall: ein Lehrbuchbefund, der einer statistischen Prüfung nicht standhält, während der Bystander-Effekt sie besteht.
- Das Marshmallow-Versprechen: Warum ein Süßigkeitentest über ein halbes Jahrhundert die Willenskraft neu definierte – und dann selbst auf die Probe gestellt wurde – wie die Replikationskrise Lehrbuchklassiker verändert hat, und warum das nicht automatisch Widerlegung heißt.
- Das Kind im Teich: Wie ein dreiseitiger Aufsatz von Peter Singer eine weltweite Bewegung auslöste – und warum die Frage, wie weit unsere Pflichten reichen, bis in die Chefetagen der Tech-Milliardäre nachhallt – die normative Schwesterfrage: Singer fragt, wann wir helfen müssen; dieser Artikel fragt, warum wir es unter Zeugen seltener tun.
- Der sanfte Schubs: Warum ein vorangekreuztes Kästchen mehr bewirkt als jedes Argument – und ob es erlaubt ist, Menschen zu ihrem Glück zu schubsen – die Interventionsseite: Wenn Verhalten von der Situation abhängt, wird die Gestaltung der Situation zur ethischen Entscheidung.
- Der Preis der Rechtfertigung: Kognitive Dissonanz von Festinger zur Neurowissenschaft – was im Kopf derer passiert, die nicht eingegriffen haben, wenn sie später darüber nachdenken.
- Der lange Schwanz der Latenz: Tail Latency und warum Mittelwerte in der Cloud lügen – die identische Formel \(P = 1-(1-p)^n\), dort als Bedrohung, hier als Rettung.
- Das Flüstern der Maschinen: Gossip-Protokolle, SWIM und wie ein Cluster erfährt, wer noch lebt – Verantwortungszuweisung als Protokollproblem: Wer erkennt den Ausfall, und wer handelt daraufhin?
- Verluste wiegen schwerer: Wie die Prospect Theory den rationalen Menschen entthronte – und warum ihr berühmtestes Prinzip heute selbst auf dem Prüfstand steht – warum die Kosten des Eingreifens (Blamage, Verletzung) psychologisch schwerer wiegen als der entgangene Nutzen des Helfens.
Quellen
- Darley, J. M., & Latané, B. (1968): Bystander intervention in emergencies: Diffusion of responsibility. Journal of Personality and Social Psychology, 8(4), 377–383. DOI: 10.1037/h0025589
- Latané, B., & Darley, J. M. (1968): Group inhibition of bystander intervention in emergencies. Journal of Personality and Social Psychology, 10(3), 215–221. DOI: 10.1037/h0026570
- Latané, B., & Rodin, J. (1969): A lady in distress: Inhibiting effects of friends and strangers on bystander intervention. Journal of Experimental Social Psychology, 5(2), 189–202. DOI: 10.1016/0022-1031(69)90046-8
- Latané, B., & Nida, S. (1981): Ten years of research on group size and helping. Psychological Bulletin, 89(2), 308–324. DOI: 10.1037/0033-2909.89.2.308
- Manning, R., Levine, M., & Collins, A. (2007): The Kitty Genovese murder and the social psychology of helping: The parable of the 38 witnesses. American Psychologist, 62(6), 555–562. DOI: 10.1037/0003-066X.62.6.555
- Fischer, P., Krueger, J. I., Greitemeyer, T., Vogrincic, C., Kastenmüller, A., Frey, D., Heene, M., Wicher, M., & Kainbacher, M. (2011): The bystander-effect: A meta-analytic review on bystander intervention in dangerous and non-dangerous emergencies. Psychological Bulletin, 137(4), 517–537. DOI: 10.1037/a0023304
- Hortensius, R., & de Gelder, B. (2018): From empathy to apathy: The bystander effect revisited. Current Directions in Psychological Science, 27(4), 249–256. DOI: 10.1177/0963721417749653
- Kazerooni, F., Taylor, S. H., Bazarova, N. N., & Whitlock, J. (2018): Cyberbullying bystander intervention: The number of offenders and retweeting predict likelihood of helping a cyberbullying victim. Journal of Computer-Mediated Communication, 23(3), 146–162. DOI: 10.1093/jcmc/zmy005
- Philpot, R., Liebst, L. S., Levine, M., Bernasco, W., & Lindegaard, M. R. (2020): Would I be helped? Cross-national CCTV footage shows that intervention is the norm in public conflicts. American Psychologist, 75(1), 66–75. DOI: 10.1037/amp0000469
- Lindegaard, M. R., Liebst, L. S., Philpot, R., Levine, M., & Bernasco, W. (2022): Does danger level affect bystander intervention in real-life conflicts? Evidence from CCTV footage. Social Psychological and Personality Science, 13(4), 795–802. DOI: 10.1177/19485506211042683