Identität und Ähnlichkeit
Beide werden Spalte für Spalte aus einem Alignment abgelesen. Die prozentuale Identität ist der Anteil der Spalten, in denen beide Sequenzen denselben Rest haben. Die prozentuale Ähnlichkeit zählt zusätzlich Spalten, in denen sich die Reste unterscheiden, aber chemisch verwandt sind, etwa Leucin gegen Isoleucin oder Aspartat gegen Glutamat. Ähnlichkeit ist nur bei Proteinen sinnvoll; bei DNA zählt die Identität.
Der Nenner ist entscheidend
Zwei Sequenzen mit 90 identischen Spalten lassen sich als 90 % identisch über ein 100 Spalten langes Alignment angeben, als 75 % über die längere Sequenz mit 120 Resten oder als 95 % über die 95 Spalten ohne Lücken. Die Programme unterscheiden sich:
- BLAST teilt durch die Alignmentlänge einschließlich Lücken.
- EMBOSS Needle macht dasselbe, gibt Lücken aber getrennt an.
- Manche Programme teilen durch die kürzere Sequenz, was den Wert für ein kurzes Fragment aufbläht, das zu einem Teil eines langen Proteins passt.
Wenn du eine Zahl zitierst, nenne den Nenner und ob das Alignment global oder lokal war.
Welche Reste ähnlich sind
Ähnlichkeitsgruppen folgen meist den positiven Werten der BLOSUM62-Matrix. Übliche Gruppen: I, L, V und M; F, Y und W; K, R und H; D und E; N und Q; S und T; A und G. Die meisten Programme zeigen ihre Regel; das Werkzeug Identität und Ähnlichkeit hier markiert identische und ähnliche Spalten getrennt.
Was die Zahlen bedeuten
Zwei Proteine, die über ihre ganze Länge zu mehr als 30 % identisch sind, sind fast immer homolog und haben dieselbe Faltung. Zwischen 20 und 30 % liegt die Grauzone, in der ein Alignment echt oder Zufall sein kann; dort ist der statistische E-Wert einer Datenbanksuche der bessere Maßstab. DNA divergiert an stillen Positionen schneller, sodass zwei Gene, die nahezu identische Proteine kodieren, auf DNA-Ebene nur zu 70 % identisch sein können.
Berechnen
- Aligniere die Sequenzen mit Zwei Proteine alignieren oder Zwei DNA-Sequenzen alignieren, oder füge ein vorhandenes Alignment ein.
- Füge die alignierten Sequenzen in Identität und Ähnlichkeit ein. Es zählt identische und ähnliche Spalten und gibt beide Prozentwerte mit der Alignmentlänge aus.