/[suikacvs]/markup/html/whatpm/Whatpm/HTML/Tokenizer.pm

Diff of /markup/html/whatpm/Whatpm/HTML/Tokenizer.pm

Parent Directory | Revision Log | View Patch Patch

-revision 1.4 by wakaba,
Tue Oct 14 11:46:57 2008 UTC
+revision 1.17 by wakaba,
Sun Oct 19 04:39:25 2008 UTC
 Line 15 
 BEGIN {
      CHARACTER_TOKEN
      PI_TOKEN
      ABORT_TOKEN
+     END_OF_DOCTYPE_TOKEN
+     ATTLIST_TOKEN
+     ELEMENT_TOKEN
+     GENERAL_ENTITY_TOKEN
+     PARAMETER_ENTITY_TOKEN
+     NOTATION_TOKEN
    );
    our %EXPORT_TAGS = (
-Line 27 
 BEGIN {
+Line 33 
 BEGIN {
        CHARACTER_TOKEN
        PI_TOKEN
        ABORT_TOKEN
+       END_OF_DOCTYPE_TOKEN
+       ATTLIST_TOKEN
+       ELEMENT_TOKEN
+       GENERAL_ENTITY_TOKEN
+       PARAMETER_ENTITY_TOKEN
+       NOTATION_TOKEN
      )],
    );
  }
+ ## NOTE: Differences from the XML5 draft are marked as "XML5:".
  ## Token types
- sub DOCTYPE_TOKEN () { 1 }
+ sub DOCTYPE_TOKEN () { 1 } ## XML5: No DOCTYPE token.
  sub COMMENT_TOKEN () { 2 }
  sub START_TAG_TOKEN () { 3 }
  sub END_TAG_TOKEN () { 4 }
  sub END_OF_FILE_TOKEN () { 5 }
  sub CHARACTER_TOKEN () { 6 }
- sub PI_TOKEN () { 7 } # XML5
+ sub PI_TOKEN () { 7 } ## NOTE: XML only.
- sub ABORT_TOKEN () { 8 } # Not a token actually
+ sub ABORT_TOKEN () { 8 } ## NOTE: For internal processing.
+ sub END_OF_DOCTYPE_TOKEN () { 9 } ## NOTE: XML only.
+ sub ATTLIST_TOKEN () { 10 } ## NOTE: XML only.
+ sub ELEMENT_TOKEN () { 11 } ## NOTE: XML only.
+ sub GENERAL_ENTITY_TOKEN () { 12 } ## NOTE: XML only.
+ sub PARAMETER_ENTITY_TOKEN () { 13 } ## NOTE: XML only.
+ sub NOTATION_TOKEN () { 14 } ## NOTE: XML only.
+ ## XML5: XML5 has "empty tag token".  In this implementation, it is
+ ## represented as a start tag token with $self->{self_closing} flag
+ ## set to true.
+ ## XML5: XML5 has "short end tag token".  In this implementation, it
+ ## is represented as an end tag token with $token->{tag_name} flag set
+ ## to an empty string.
  package Whatpm::HTML;
-Line 114 
 sub HEXREF_HEX_STATE () { 48 }
+Line 142 
 sub HEXREF_HEX_STATE () { 48 }
  sub ENTITY_NAME_STATE () { 49 }
  sub PCDATA_STATE () { 50 } # "data state" in the spec
+ ## XML-only states
+ sub PI_STATE () { 51 }
+ sub PI_TARGET_STATE () { 52 }
+ sub PI_TARGET_AFTER_STATE () { 53 }
+ sub PI_DATA_STATE () { 54 }
+ sub PI_AFTER_STATE () { 55 }
+ sub PI_DATA_AFTER_STATE () { 56 }
+ sub DOCTYPE_INTERNAL_SUBSET_STATE () { 57 }
+ sub DOCTYPE_INTERNAL_SUBSET_AFTER_STATE () { 58 }
+ sub BOGUS_DOCTYPE_INTERNAL_SUBSET_AFTER_STATE () { 59 }
+ sub DOCTYPE_TAG_STATE () { 60 }
+ sub DOCTYPE_MARKUP_DECLARATION_OPEN_STATE () { 61 }
+ sub MD_ATTLIST_STATE () { 62 }
+ sub MD_E_STATE () { 63 }
+ sub MD_ELEMENT_STATE () { 64 }
+ sub MD_ENTITY_STATE () { 65 }
+ sub MD_NOTATION_STATE () { 66 }
+ sub DOCTYPE_MD_STATE () { 67 }
+ sub BEFORE_MD_NAME_STATE () { 68 }
+ sub MD_NAME_STATE () { 69 }
+ sub DOCTYPE_ENTITY_PARAMETER_BEFORE_STATE () { 70 }
+ sub DOCTYPE_ATTLIST_NAME_AFTER_STATE () { 71 }
+ sub DOCTYPE_ATTLIST_ATTRIBUTE_NAME_STATE () { 72 }
+ sub DOCTYPE_ATTLIST_ATTRIBUTE_NAME_AFTER_STATE () { 73 }
+ sub DOCTYPE_ATTLIST_ATTRIBUTE_TYPE_STATE () { 74 }
+ sub DOCTYPE_ATTLIST_ATTRIBUTE_TYPE_AFTER_STATE () { 75 }
+ sub BEFORE_ALLOWED_TOKEN_STATE () { 76 }
+ sub ALLOWED_TOKEN_STATE () { 77 }
+ sub AFTER_ALLOWED_TOKEN_STATE () { 78 }
+ sub AFTER_ALLOWED_TOKENS_STATE () { 79 }
+ sub BEFORE_ATTR_DEFAULT_STATE () { 80 }
+ sub DOCTYPE_ATTLIST_ATTRIBUTE_DECLARATION_BEFORE_STATE () { 81 }
+ sub DOCTYPE_ATTLIST_ATTRIBUTE_DECLARATION_STATE () { 82 }
+ sub DOCTYPE_ATTLIST_ATTRIBUTE_DECLARATION_AFTER_STATE () { 83 }
+ sub AFTER_ATTLIST_ATTR_VALUE_QUOTED_STATE () { 84 }
+ sub BOGUS_MD_STATE () { 85 }
  ## Tree constructor state constants (see Whatpm::HTML for the full
  ## list and descriptions)
-Line 178 
 sub _initialize_tokenizer ($) {
+Line 243 
 sub _initialize_tokenizer ($) {
    #$self->{is_xml} (if XML)
    $self->{state} = DATA_STATE; # MUST
-   #$self->{s_kwd}; # state keyword - initialized when used
+   $self->{s_kwd} = ''; # Data state keyword
+   #$self->{kwd} = ''; # State-dependent keyword; initialized when used
    #$self->{entity__value}; # initialized when used
    #$self->{entity__match}; # initialized when used
    $self->{content_model} = PCDATA_CONTENT_MODEL; # be
-Line 208 
 sub _initialize_tokenizer ($) {
+Line 274 
 sub _initialize_tokenizer ($) {
  ## A token has:
  ##   ->{type} == DOCTYPE_TOKEN, START_TAG_TOKEN, END_TAG_TOKEN, COMMENT_TOKEN,
- ##       CHARACTER_TOKEN, or END_OF_FILE_TOKEN
+ ##       CHARACTER_TOKEN, END_OF_FILE_TOKEN, PI_TOKEN, or ABORT_TOKEN
  ##   ->{name} (DOCTYPE_TOKEN)
  ##   ->{tag_name} (START_TAG_TOKEN, END_TAG_TOKEN)
+ ##   ->{target} (PI_TOKEN)
  ##   ->{pubid} (DOCTYPE_TOKEN)
  ##   ->{sysid} (DOCTYPE_TOKEN)
  ##   ->{quirks} == 1 or 0 (DOCTYPE_TOKEN): "force-quirks" flag
-Line 218 
 sub _initialize_tokenizer ($) {
+Line 285 
 sub _initialize_tokenizer ($) {
  ##        ->{name}
  ##        ->{value}
  ##        ->{has_reference} == 1 or 0
- ##   ->{data} (COMMENT_TOKEN, CHARACTER_TOKEN)
+ ##        ->{index}: Index of the attribute in a tag.
+ ##   ->{data} (COMMENT_TOKEN, CHARACTER_TOKEN, PI_TOKEN)
+ ##   ->{has_reference} == 1 or 0 (CHARACTER_TOKEN)
+ ##   ->{last_index} (ELEMENT_TOKEN): Next attribute's index - 1.
+ ##   ->{has_internal_subset} = 1 or 0 (DOCTYPE_TOKEN)
  ## NOTE: The "self-closing flag" is hold as |$self->{self_closing}|.
  ##     |->{self_closing}| is used to save the value of |$self->{self_closing}|
  ##     while the token is pushed back to the stack.
-Line 238 
 my $is_space = {
+Line 310 
 my $is_space = {
 x0009 => 1, # CHARACTER TABULATION (HT)
 x000A => 1, # LINE FEED (LF)
    #0x000B => 0, # LINE TABULATION (VT)
-x000C => 1, # FORM FEED (FF)
+x000C => 1, # FORM FEED (FF) ## XML5: Not a space character.
    #0x000D => 1, # CARRIAGE RETURN (CR)
 x0020 => 1, # SPACE (SP)
  };
-Line 362 
 sub _get_next_token ($) {
+Line 434 
 sub _get_next_token ($) {
          }
        } elsif ($self->{nc} == 0x002D) { # -
          if ($self->{content_model} & CM_LIMITED_MARKUP) { # RCDATA | CDATA
-           $self->{s_kwd} .= '-';
+           if ($self->{s_kwd} eq '<!-') {
-           if ($self->{s_kwd} eq '<!--') {
              $self->{escape} = 1; # unless $self->{escape};
              $self->{s_kwd} = '--';
              #
-           } elsif ($self->{s_kwd} eq '---') {
+           } elsif ($self->{s_kwd} eq '-') {
              $self->{s_kwd} = '--';
              #
+           } elsif ($self->{s_kwd} eq '<!' or $self->{s_kwd} eq '-') {
+             $self->{s_kwd} .= '-';
+             #
            } else {
+             $self->{s_kwd} = '-';
              #
            }
          }
-Line 420 
 sub _get_next_token ($) {
+Line 495 
 sub _get_next_token ($) {
            if ($self->{s_kwd} eq '--') {
              delete $self->{escape};
+             #
            } else {
+             #
            }
+         } elsif ($self->{is_xml} and $self->{s_kwd} eq ']]') {
+           $self->{parse_error}->(level => $self->{level}->{must}, type => 'unmatched mse', ## TODO: type
+                           line => $self->{line_prev},
+                           column => $self->{column_prev} - 1);
+           #
          } else {
+           #
          }
          $self->{s_kwd} = '';
          #
+       } elsif ($self->{nc} == 0x005D) { # ]
+         if ($self->{s_kwd} eq ']' or $self->{s_kwd} eq '') {
+           $self->{s_kwd} .= ']';
+         } elsif ($self->{s_kwd} eq ']]') {
+           #
+         } else {
+           $self->{s_kwd} = '';
+         }
+         #
        } elsif ($self->{nc} == -1) {
          $self->{s_kwd} = '';
-Line 446 
 sub _get_next_token ($) {
+Line 542 
 sub _get_next_token ($) {
                     data => chr $self->{nc},
                     line => $self->{line}, column => $self->{column},
                    };
-       if ($self->{read_until}->($token->{data}, q[-!<>&],
+       if ($self->{read_until}->($token->{data}, q{-!<>&\]},
                                  length $token->{data})) {
          $self->{s_kwd} = '';
        }
        ## Stay in the data state.
-       if ($self->{content_model} == PCDATA_CONTENT_MODEL) {
+       if (not $self->{is_xml} and
+           $self->{content_model} == PCDATA_CONTENT_MODEL) {
          $self->{state} = PCDATA_STATE;
        } else {
-Line 473 
 sub _get_next_token ($) {
+Line 570 
 sub _get_next_token ($) {
        return  ($token);
        redo A;
      } elsif ($self->{state} == TAG_OPEN_STATE) {
+       ## XML5: "tag state".
        if ($self->{content_model} & CM_LIMITED_MARKUP) { # RCDATA | CDATA
          if ($self->{nc} == 0x002F) { # /
-Line 491 
 sub _get_next_token ($) {
+Line 590 
 sub _get_next_token ($) {
            redo A;
          } elsif ($self->{nc} == 0x0021) { # !
-           $self->{s_kwd} = '<' unless $self->{escape};
+           $self->{s_kwd} = $self->{escaped} ? '' : '<';
            #
          } else {
+           $self->{s_kwd} = '';
            #
          }
-Line 583 
 sub _get_next_token ($) {
+Line 683 
 sub _get_next_token ($) {
                            line => $self->{line_prev},
                            column => $self->{column_prev});
            $self->{state} = DATA_STATE;
+           $self->{s_kwd} = '';
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 602 
 sub _get_next_token ($) {
+Line 703 
 sub _get_next_token ($) {
            redo A;
          } elsif ($self->{nc} == 0x003F) { # ?
+           if ($self->{is_xml}) {
-           $self->{parse_error}->(level => $self->{level}->{must}, type => 'pio',
-                           line => $self->{line_prev},
+             $self->{state} = PI_STATE;
-                           column => $self->{column_prev});
-           $self->{state} = BOGUS_COMMENT_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
-           $self->{ct} = {type => COMMENT_TOKEN, data => '',
+       $self->{line_prev} = $self->{line};
-                                     line => $self->{line_prev},
+       $self->{column_prev} = $self->{column};
-                                     column => $self->{column_prev},
+       $self->{column}++;
-                                    };
+       $self->{nc}
-           ## $self->{nc} is intentionally left as is
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
-           redo A;
+     } else {
-         } else {
+       $self->{set_nc}->($self);
+     }
+             redo A;
+           } else {
+             $self->{parse_error}->(level => $self->{level}->{must}, type => 'pio',
+                             line => $self->{line_prev},
+                             column => $self->{column_prev});
+             $self->{state} = BOGUS_COMMENT_STATE;
+             $self->{ct} = {type => COMMENT_TOKEN, data => '',
+                            line => $self->{line_prev},
+                            column => $self->{column_prev},
+                           };
+             ## $self->{nc} is intentionally left as is
+             redo A;
+           }
+         } elsif (not $self->{is_xml} or $is_space->{$self->{nc}}) {
            $self->{parse_error}->(level => $self->{level}->{must}, type => 'bare stago',
                            line => $self->{line_prev},
                            column => $self->{column_prev});
            $self->{state} = DATA_STATE;
+           $self->{s_kwd} = '';
            ## reconsume
            return  ({type => CHARACTER_TOKEN, data => '<',
-Line 627 
 sub _get_next_token ($) {
+Line 746 
 sub _get_next_token ($) {
                     });
            redo A;
+         } else {
+           ## XML5: "<:" is a parse error.
+           $self->{ct} = {type => START_TAG_TOKEN,
+                                     tag_name => chr ($self->{nc}),
+                                     line => $self->{line_prev},
+                                     column => $self->{column_prev}};
+           $self->{state} = TAG_NAME_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+           redo A;
          }
        } else {
          die "$0: $self->{content_model} in tag open";
-Line 635 
 sub _get_next_token ($) {
+Line 774 
 sub _get_next_token ($) {
        ## NOTE: The "close tag open state" in the spec is implemented as
        ## |CLOSE_TAG_OPEN_STATE| and |CDATA_RCDATA_CLOSE_TAG_STATE|.
+       ## XML5: "end tag state".
        my ($l, $c) = ($self->{line_prev}, $self->{column_prev} - 1); # "<"of"</"
        if ($self->{content_model} & CM_LIMITED_MARKUP) { # RCDATA | CDATA
          if (defined $self->{last_stag_name}) {
            $self->{state} = CDATA_RCDATA_CLOSE_TAG_STATE;
-           $self->{s_kwd} = '';
+           $self->{kwd} = '';
            ## Reconsume.
            redo A;
          } else {
-Line 647 
 sub _get_next_token ($) {
+Line 788 
 sub _get_next_token ($) {
            ## NOTE: See <http://krijnhoetmer.nl/irc-logs/whatwg/20070626#l-564>.
            $self->{state} = DATA_STATE;
+           $self->{s_kwd} = '';
            ## Reconsume.
            return  ({type => CHARACTER_TOKEN, data => '</',
                      line => $l, column => $c,
-Line 695 
 sub _get_next_token ($) {
+Line 837 
 sub _get_next_token ($) {
          redo A;
        } elsif ($self->{nc} == 0x003E) { # >
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'empty end tag',
                          line => $self->{line_prev}, ## "<" in "</>"
                          column => $self->{column_prev} - 1);
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
+         if ($self->{is_xml}) {
+           ## XML5: No parse error.
+           ## NOTE: This parser raises a parse error, since it supports
+           ## XML1, not XML5.
+           ## NOTE: A short end tag token.
+           my $ct = {type => END_TAG_TOKEN,
+                     tag_name => '',
+                     line => $self->{line_prev},
+                     column => $self->{column_prev} - 1,
+                    };
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
        $self->{column_prev} = $self->{column};
-Line 711 
 sub _get_next_token ($) {
+Line 866 
 sub _get_next_token ($) {
        $self->{set_nc}->($self);
      }
+           return  ($ct);
+         } else {
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         }
          redo A;
        } elsif ($self->{nc} == -1) {
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'bare etago');
+         $self->{s_kwd} = '';
          $self->{state} = DATA_STATE;
          # reconsume
-Line 723 
 sub _get_next_token ($) {
+Line 894 
 sub _get_next_token ($) {
                   });
          redo A;
-       } else {
+       } elsif (not $self->{is_xml} or
+                $is_space->{$self->{nc}}) {
-         $self->{parse_error}->(level => $self->{level}->{must}, type => 'bogus end tag');
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'bogus end tag',
+                         line => $self->{line_prev}, # "<" of "</"
+                         column => $self->{column_prev} - 1);
          $self->{state} = BOGUS_COMMENT_STATE;
          $self->{ct} = {type => COMMENT_TOKEN, data => '',
                                    line => $self->{line_prev}, # "<" of "</"
-Line 738 
 sub _get_next_token ($) {
+Line 912 
 sub _get_next_token ($) {
          ## generated from the bogus end tag, as defined in the
          ## "bogus comment state" entry.
          redo A;
+       } else {
+         ## XML5: "</:" is a parse error.
+         $self->{ct} = {type => END_TAG_TOKEN,
+                        tag_name => chr ($self->{nc}),
+                        line => $l, column => $c};
+         $self->{state} = TAG_NAME_STATE; ## XML5: "end tag name state".
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
        }
      } elsif ($self->{state} == CDATA_RCDATA_CLOSE_TAG_STATE) {
-       my $ch = substr $self->{last_stag_name}, length $self->{s_kwd}, 1;
+       my $ch = substr $self->{last_stag_name}, length $self->{kwd}, 1;
        if (length $ch) {
          my $CH = $ch;
          $ch =~ tr/a-z/A-Z/;
-Line 748 
 sub _get_next_token ($) {
+Line 941 
 sub _get_next_token ($) {
          if ($nch eq $ch or $nch eq $CH) {
            ## Stay in the state.
-           $self->{s_kwd} .= $nch;
+           $self->{kwd} .= $nch;
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 764 
 sub _get_next_token ($) {
+Line 957 
 sub _get_next_token ($) {
          } else {
            $self->{state} = DATA_STATE;
+           $self->{s_kwd} = '';
            ## Reconsume.
            return  ({type => CHARACTER_TOKEN,
-                     data => '</' . $self->{s_kwd},
+                     data => '</' . $self->{kwd},
                      line => $self->{line_prev},
-                     column => $self->{column_prev} - 1 - length $self->{s_kwd},
+                     column => $self->{column_prev} - 1 - length $self->{kwd},
                     });
            redo A;
          }
-Line 782 
 sub _get_next_token ($) {
+Line 976 
 sub _get_next_token ($) {
            ## Reconsume.
            $self->{state} = DATA_STATE;
+           $self->{s_kwd} = '';
            return  ({type => CHARACTER_TOKEN,
-                     data => '</' . $self->{s_kwd},
+                     data => '</' . $self->{kwd},
                      line => $self->{line_prev},
-                     column => $self->{column_prev} - 1 - length $self->{s_kwd},
+                     column => $self->{column_prev} - 1 - length $self->{kwd},
                     });
            redo A;
          } else {
-Line 794 
 sub _get_next_token ($) {
+Line 989 
 sub _get_next_token ($) {
                = {type => END_TAG_TOKEN,
                   tag_name => $self->{last_stag_name},
                   line => $self->{line_prev},
-                  column => $self->{column_prev} - 1 - length $self->{s_kwd}};
+                  column => $self->{column_prev} - 1 - length $self->{kwd}};
            $self->{state} = TAG_NAME_STATE;
            ## Reconsume.
            redo A;
-Line 833 
 sub _get_next_token ($) {
+Line 1028 
 sub _get_next_token ($) {
            die "$0: $self->{ct}->{type}: Unknown token type";
          }
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 885 
 sub _get_next_token ($) {
+Line 1081 
 sub _get_next_token ($) {
            die "$0: $self->{ct}->{type}: Unknown token type";
          }
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
          # reconsume
          return  ($self->{ct}); # start tag or end tag
-Line 924 
 sub _get_next_token ($) {
+Line 1121 
 sub _get_next_token ($) {
          redo A;
        }
      } elsif ($self->{state} == BEFORE_ATTRIBUTE_NAME_STATE) {
+       ## XML5: "Tag attribute name before state".
        if ($is_space->{$self->{nc}}) {
          ## Stay in the state
-Line 955 
 sub _get_next_token ($) {
+Line 1154 
 sub _get_next_token ($) {
            die "$0: $self->{ct}->{type}: Unknown token type";
          }
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 1022 
 sub _get_next_token ($) {
+Line 1222 
 sub _get_next_token ($) {
            die "$0: $self->{ct}->{type}: Unknown token type";
          }
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
          # reconsume
          return  ($self->{ct}); # start tag or end tag
-Line 1034 
 sub _get_next_token ($) {
+Line 1235 
 sub _get_next_token ($) {
 x003D => 1, # =
              }->{$self->{nc}}) {
+           ## XML5: Not a parse error.
            $self->{parse_error}->(level => $self->{level}->{must}, type => 'bad attribute name');
          } else {
+           ## XML5: ":" raises a parse error and is ignored.
          }
          $self->{ca}
              = {name => chr ($self->{nc}),
-Line 1057 
 sub _get_next_token ($) {
+Line 1260 
 sub _get_next_token ($) {
          redo A;
        }
      } elsif ($self->{state} == ATTRIBUTE_NAME_STATE) {
+       ## XML5: "Tag attribute name state".
        my $before_leave = sub {
          if (exists $self->{ct}->{attributes} # start tag or end tag
              ->{$self->{ca}->{name}}) { # MUST
-Line 1067 
 sub _get_next_token ($) {
+Line 1272 
 sub _get_next_token ($) {
            $self->{ct}->{attributes}->{$self->{ca}->{name}}
              = $self->{ca};
+           $self->{ca}->{index} = ++$self->{ct}->{last_index};
          }
        }; # $before_leave
-Line 1103 
 sub _get_next_token ($) {
+Line 1309 
 sub _get_next_token ($) {
          redo A;
        } elsif ($self->{nc} == 0x003E) { # >
+         if ($self->{is_xml}) {
+           ## XML5: Not a parse error.
+           $self->{parse_error}->(level => $self->{level}->{must}, type => 'no attr value'); ## TODO: type
+         } else {
+         }
          $before_leave->();
          if ($self->{ct}->{type} == START_TAG_TOKEN) {
-Line 1117 
 sub _get_next_token ($) {
+Line 1331 
 sub _get_next_token ($) {
            die "$0: $self->{ct}->{type}: Unknown token type";
          }
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 1151 
 sub _get_next_token ($) {
+Line 1366 
 sub _get_next_token ($) {
          redo A;
        } elsif ($self->{nc} == 0x002F) { # /
+         if ($self->{is_xml}) {
+           ## XML5: Not a parse error.
+           $self->{parse_error}->(level => $self->{level}->{must}, type => 'no attr value'); ## TODO: type
+         } else {
+         }
          $before_leave->();
          $self->{state} = SELF_CLOSING_START_TAG_STATE;
-Line 1185 
 sub _get_next_token ($) {
+Line 1407 
 sub _get_next_token ($) {
            die "$0: $self->{ct}->{type}: Unknown token type";
          }
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
          # reconsume
          return  ($self->{ct}); # start tag or end tag
-Line 1194 
 sub _get_next_token ($) {
+Line 1417 
 sub _get_next_token ($) {
          if ($self->{nc} == 0x0022 or # "
              $self->{nc} == 0x0027) { # '
+           ## XML5: Not a parse error.
            $self->{parse_error}->(level => $self->{level}->{must}, type => 'bad attribute name');
          } else {
-Line 1214 
 sub _get_next_token ($) {
+Line 1438 
 sub _get_next_token ($) {
          redo A;
        }
      } elsif ($self->{state} == AFTER_ATTRIBUTE_NAME_STATE) {
+       ## XML5: "Tag attribute name after state".
        if ($is_space->{$self->{nc}}) {
          ## Stay in the state
-Line 1245 
 sub _get_next_token ($) {
+Line 1471 
 sub _get_next_token ($) {
          redo A;
        } elsif ($self->{nc} == 0x003E) { # >
+         if ($self->{is_xml}) {
+           ## XML5: Not a parse error.
+           $self->{parse_error}->(level => $self->{level}->{must}, type => 'no attr value'); ## TODO: type
+         } else {
+         }
          if ($self->{ct}->{type} == START_TAG_TOKEN) {
            $self->{last_stag_name} = $self->{ct}->{tag_name};
-Line 1261 
 sub _get_next_token ($) {
+Line 1495 
 sub _get_next_token ($) {
            die "$0: $self->{ct}->{type}: Unknown token type";
          }
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 1297 
 sub _get_next_token ($) {
+Line 1532 
 sub _get_next_token ($) {
          redo A;
        } elsif ($self->{nc} == 0x002F) { # /
+         if ($self->{is_xml}) {
+           ## XML5: Not a parse error.
+           $self->{parse_error}->(level => $self->{level}->{must}, type => 'no attr value'); ## TODO: type
+         } else {
+         }
          $self->{state} = SELF_CLOSING_START_TAG_STATE;
-Line 1328 
 sub _get_next_token ($) {
+Line 1570 
 sub _get_next_token ($) {
          } else {
            die "$0: $self->{ct}->{type}: Unknown token type";
          }
+         $self->{s_kwd} = '';
          $self->{state} = DATA_STATE;
          # reconsume
-Line 1335 
 sub _get_next_token ($) {
+Line 1578 
 sub _get_next_token ($) {
          redo A;
        } else {
+         if ($self->{is_xml}) {
+           ## XML5: Not a parse error.
+           $self->{parse_error}->(level => $self->{level}->{must}, type => 'no attr value'); ## TODO: type
+         } else {
+         }
          if ($self->{nc} == 0x0022 or # "
              $self->{nc} == 0x0027) { # '
+           ## XML5: Not a parse error.
            $self->{parse_error}->(level => $self->{level}->{must}, type => 'bad attribute name');
          } else {
-Line 1361 
 sub _get_next_token ($) {
+Line 1613 
 sub _get_next_token ($) {
          redo A;
        }
      } elsif ($self->{state} == BEFORE_ATTRIBUTE_VALUE_STATE) {
+       ## XML5: "Tag attribute value before state".
        if ($is_space->{$self->{nc}}) {
          ## Stay in the state
-Line 1429 
 sub _get_next_token ($) {
+Line 1683 
 sub _get_next_token ($) {
            die "$0: $self->{ct}->{type}: Unknown token type";
          }
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 1462 
 sub _get_next_token ($) {
+Line 1717 
 sub _get_next_token ($) {
            die "$0: $self->{ct}->{type}: Unknown token type";
          }
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
          ## reconsume
          return  ($self->{ct}); # start tag or end tag
-Line 1470 
 sub _get_next_token ($) {
+Line 1726 
 sub _get_next_token ($) {
        } else {
          if ($self->{nc} == 0x003D) { # =
+           ## XML5: Not a parse error.
            $self->{parse_error}->(level => $self->{level}->{must}, type => 'bad attribute value');
+         } elsif ($self->{is_xml}) {
+           ## XML5: No parse error.
+           $self->{parse_error}->(level => $self->{level}->{must}, type => 'unquoted attr value'); ## TODO
          } else {
          }
-Line 1490 
 sub _get_next_token ($) {
+Line 1751 
 sub _get_next_token ($) {
          redo A;
        }
      } elsif ($self->{state} == ATTRIBUTE_VALUE_DOUBLE_QUOTED_STATE) {
+       ## XML5: "Tag attribute value double quoted state" and "DOCTYPE
+       ## ATTLIST attribute value double quoted state".
        if ($self->{nc} == 0x0022) { # "
+         if ($self->{ct}->{type} == ATTLIST_TOKEN) {
-         $self->{state} = AFTER_ATTRIBUTE_VALUE_QUOTED_STATE;
+           ## XML5: "DOCTYPE ATTLIST name after state".
+           push @{$self->{ct}->{attrdefs}}, $self->{ca};
+           $self->{state} = AFTER_ATTLIST_ATTR_VALUE_QUOTED_STATE;
+         } else {
+           ## XML5: "Tag attribute name before state".
+           $self->{state} = AFTER_ATTRIBUTE_VALUE_QUOTED_STATE;
+         }
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 1507 
 sub _get_next_token ($) {
+Line 1779 
 sub _get_next_token ($) {
          redo A;
        } elsif ($self->{nc} == 0x0026) { # &
+         ## XML5: Not defined yet.
          ## NOTE: In the spec, the tokenizer is switched to the
          ## "entity in attribute value state".  In this implementation, the
          ## tokenizer is switched to the |ENTITY_STATE|, which is an
-Line 1531 
 sub _get_next_token ($) {
+Line 1805 
 sub _get_next_token ($) {
          if ($self->{ct}->{type} == START_TAG_TOKEN) {
            $self->{last_stag_name} = $self->{ct}->{tag_name};
+           $self->{state} = DATA_STATE;
+           $self->{s_kwd} = '';
+           ## reconsume
+           return  ($self->{ct}); # start tag
+           redo A;
          } elsif ($self->{ct}->{type} == END_TAG_TOKEN) {
            $self->{content_model} = PCDATA_CONTENT_MODEL; # MUST
            if ($self->{ct}->{attributes}) {
-Line 1540 
 sub _get_next_token ($) {
+Line 1820 
 sub _get_next_token ($) {
              ## NOTE: This state should never be reached.
            }
+           $self->{state} = DATA_STATE;
+           $self->{s_kwd} = '';
+           ## reconsume
+           return  ($self->{ct}); # end tag
+           redo A;
+         } elsif ($self->{ct}->{type} == ATTLIST_TOKEN) {
+           ## XML5: No parse error above; not defined yet.
+           push @{$self->{ct}->{attrdefs}}, $self->{ca};
+           $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+           ## Reconsume.
+           return  ($self->{ct}); # ATTLIST
+           redo A;
          } else {
            die "$0: $self->{ct}->{type}: Unknown token type";
          }
-         $self->{state} = DATA_STATE;
-         ## reconsume
-         return  ($self->{ct}); # start tag or end tag
-         redo A;
        } else {
+         ## XML5 [ATTLIST]: Not defined yet.
+         if ($self->{is_xml} and $self->{nc} == 0x003C) { # <
+           ## XML5: Not a parse error.
+           $self->{parse_error}->(level => $self->{level}->{must}, type => 'lt in attr value'); ## TODO: type
+         } else {
+         }
          $self->{ca}->{value} .= chr ($self->{nc});
          $self->{read_until}->($self->{ca}->{value},
-                               q["&],
+                               q["&<],
                                length $self->{ca}->{value});
          ## Stay in the state
-Line 1571 
 sub _get_next_token ($) {
+Line 1865 
 sub _get_next_token ($) {
          redo A;
        }
      } elsif ($self->{state} == ATTRIBUTE_VALUE_SINGLE_QUOTED_STATE) {
+       ## XML5: "Tag attribute value single quoted state" and "DOCTYPE
+       ## ATTLIST attribute value single quoted state".
        if ($self->{nc} == 0x0027) { # '
+         if ($self->{ct}->{type} == ATTLIST_TOKEN) {
-         $self->{state} = AFTER_ATTRIBUTE_VALUE_QUOTED_STATE;
+           ## XML5: "DOCTYPE ATTLIST name after state".
+           push @{$self->{ct}->{attrdefs}}, $self->{ca};
+           $self->{state} = AFTER_ATTLIST_ATTR_VALUE_QUOTED_STATE;
+         } else {
+           ## XML5: "Before attribute name state" (sic).
+           $self->{state} = AFTER_ATTRIBUTE_VALUE_QUOTED_STATE;
+         }
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 1588 
 sub _get_next_token ($) {
+Line 1893 
 sub _get_next_token ($) {
          redo A;
        } elsif ($self->{nc} == 0x0026) { # &
+         ## XML5: Not defined yet.
          ## NOTE: In the spec, the tokenizer is switched to the
          ## "entity in attribute value state".  In this implementation, the
          ## tokenizer is switched to the |ENTITY_STATE|, which is an
-Line 1612 
 sub _get_next_token ($) {
+Line 1919 
 sub _get_next_token ($) {
          if ($self->{ct}->{type} == START_TAG_TOKEN) {
            $self->{last_stag_name} = $self->{ct}->{tag_name};
+           $self->{state} = DATA_STATE;
+           $self->{s_kwd} = '';
+           ## reconsume
+           return  ($self->{ct}); # start tag
+           redo A;
          } elsif ($self->{ct}->{type} == END_TAG_TOKEN) {
            $self->{content_model} = PCDATA_CONTENT_MODEL; # MUST
            if ($self->{ct}->{attributes}) {
-Line 1621 
 sub _get_next_token ($) {
+Line 1934 
 sub _get_next_token ($) {
              ## NOTE: This state should never be reached.
            }
+           $self->{state} = DATA_STATE;
+           $self->{s_kwd} = '';
+           ## reconsume
+           return  ($self->{ct}); # end tag
+           redo A;
+         } elsif ($self->{ct}->{type} == ATTLIST_TOKEN) {
+           ## XML5: No parse error above; not defined yet.
+           push @{$self->{ct}->{attrdefs}}, $self->{ca};
+           $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+           ## Reconsume.
+           return  ($self->{ct}); # ATTLIST
+           redo A;
          } else {
            die "$0: $self->{ct}->{type}: Unknown token type";
          }
-         $self->{state} = DATA_STATE;
-         ## reconsume
-         return  ($self->{ct}); # start tag or end tag
-         redo A;
        } else {
+         ## XML5 [ATTLIST]: Not defined yet.
+         if ($self->{is_xml} and $self->{nc} == 0x003C) { # <
+           ## XML5: Not a parse error.
+           $self->{parse_error}->(level => $self->{level}->{must}, type => 'lt in attr value'); ## TODO: type
+         } else {
+         }
          $self->{ca}->{value} .= chr ($self->{nc});
          $self->{read_until}->($self->{ca}->{value},
-                               q['&],
+                               q['&<],
                                length $self->{ca}->{value});
          ## Stay in the state
-Line 1652 
 sub _get_next_token ($) {
+Line 1979 
 sub _get_next_token ($) {
          redo A;
        }
      } elsif ($self->{state} == ATTRIBUTE_VALUE_UNQUOTED_STATE) {
+       ## XML5: "Tag attribute value unquoted state".
        if ($is_space->{$self->{nc}}) {
+         if ($self->{ct}->{type} == ATTLIST_TOKEN) {
-         $self->{state} = BEFORE_ATTRIBUTE_NAME_STATE;
+           push @{$self->{ct}->{attrdefs}}, $self->{ca};
+           $self->{state} = DOCTYPE_ATTLIST_NAME_AFTER_STATE;
+         } else {
+           ## XML5: "Tag attribute name before state".
+           $self->{state} = BEFORE_ATTRIBUTE_NAME_STATE;
+         }
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 1669 
 sub _get_next_token ($) {
+Line 2005 
 sub _get_next_token ($) {
          redo A;
        } elsif ($self->{nc} == 0x0026) { # &
+         ## XML5: Not defined yet.
          ## NOTE: In the spec, the tokenizer is switched to the
          ## "entity in attribute value state".  In this implementation, the
          ## tokenizer is switched to the |ENTITY_STATE|, which is an
-Line 1692 
 sub _get_next_token ($) {
+Line 2031 
 sub _get_next_token ($) {
          if ($self->{ct}->{type} == START_TAG_TOKEN) {
            $self->{last_stag_name} = $self->{ct}->{tag_name};
+           $self->{state} = DATA_STATE;
+           $self->{s_kwd} = '';
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+           return  ($self->{ct}); # start tag
+           redo A;
          } elsif ($self->{ct}->{type} == END_TAG_TOKEN) {
            $self->{content_model} = PCDATA_CONTENT_MODEL; # MUST
            if ($self->{ct}->{attributes}) {
-Line 1701 
 sub _get_next_token ($) {
+Line 2056 
 sub _get_next_token ($) {
              ## NOTE: This state should never be reached.
            }
-         } else {
-           die "$0: $self->{ct}->{type}: Unknown token type";
+           $self->{state} = DATA_STATE;
-         }
+           $self->{s_kwd} = '';
-         $self->{state} = DATA_STATE;
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
        $self->{column_prev} = $self->{column};
-Line 1716 
 sub _get_next_token ($) {
+Line 2070 
 sub _get_next_token ($) {
        $self->{set_nc}->($self);
      }
+           return  ($self->{ct}); # end tag
-         return  ($self->{ct}); # start tag or end tag
+           redo A;
+         } elsif ($self->{ct}->{type} == ATTLIST_TOKEN) {
-         redo A;
+           push @{$self->{ct}->{attrdefs}}, $self->{ca};
+           $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+           return  ($self->{ct}); # ATTLIST
+           redo A;
+         } else {
+           die "$0: $self->{ct}->{type}: Unknown token type";
+         }
        } elsif ($self->{nc} == -1) {
-         $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed tag');
          if ($self->{ct}->{type} == START_TAG_TOKEN) {
+           $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed tag');
            $self->{last_stag_name} = $self->{ct}->{tag_name};
+           $self->{state} = DATA_STATE;
+           $self->{s_kwd} = '';
+           ## reconsume
+           return  ($self->{ct}); # start tag
+           redo A;
          } elsif ($self->{ct}->{type} == END_TAG_TOKEN) {
+           $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed tag');
            $self->{content_model} = PCDATA_CONTENT_MODEL; # MUST
            if ($self->{ct}->{attributes}) {
-Line 1734 
 sub _get_next_token ($) {
+Line 2112 
 sub _get_next_token ($) {
              ## NOTE: This state should never be reached.
            }
+           $self->{state} = DATA_STATE;
+           $self->{s_kwd} = '';
+           ## reconsume
+           return  ($self->{ct}); # end tag
+           redo A;
+         } elsif ($self->{ct}->{type} == ATTLIST_TOKEN) {
+           $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed md'); ## TODO: type
+           push @{$self->{ct}->{attrdefs}}, $self->{ca};
+           $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+           ## Reconsume.
+           return  ($self->{ct}); # ATTLIST
+           redo A;
          } else {
            die "$0: $self->{ct}->{type}: Unknown token type";
          }
-         $self->{state} = DATA_STATE;
-         ## reconsume
-         return  ($self->{ct}); # start tag or end tag
-         redo A;
        } else {
          if ({
 x0022 => 1, # "
-Line 1750 
 sub _get_next_token ($) {
+Line 2135 
 sub _get_next_token ($) {
 x003D => 1, # =
              }->{$self->{nc}}) {
+           ## XML5: Not a parse error.
            $self->{parse_error}->(level => $self->{level}->{must}, type => 'bad attribute value');
          } else {
-Line 1806 
 sub _get_next_token ($) {
+Line 2192 
 sub _get_next_token ($) {
            die "$0: $self->{ct}->{type}: Unknown token type";
          }
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 1853 
 sub _get_next_token ($) {
+Line 2240 
 sub _get_next_token ($) {
            die "$0: $self->{ct}->{type}: Unknown token type";
          }
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
          ## Reconsume.
          return  ($self->{ct}); # start tag or end tag
          redo A;
-Line 1864 
 sub _get_next_token ($) {
+Line 2252 
 sub _get_next_token ($) {
          redo A;
        }
      } elsif ($self->{state} == SELF_CLOSING_START_TAG_STATE) {
+       ## XML5: "Empty tag state".
        if ($self->{nc} == 0x003E) { # >
          if ($self->{ct}->{type} == END_TAG_TOKEN) {
-Line 1883 
 sub _get_next_token ($) {
+Line 2273 
 sub _get_next_token ($) {
          }
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 1914 
 sub _get_next_token ($) {
+Line 2305 
 sub _get_next_token ($) {
          } else {
            die "$0: $self->{ct}->{type}: Unknown token type";
          }
+         ## XML5: "Tag attribute name before state".
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
          ## Reconsume.
          return  ($self->{ct}); # start tag or end tag
          redo A;
-Line 1927 
 sub _get_next_token ($) {
+Line 2320 
 sub _get_next_token ($) {
          redo A;
        }
      } elsif ($self->{state} == BOGUS_COMMENT_STATE) {
-       ## (only happen if PCDATA state)
+       ## XML5: "Bogus comment state" and "DOCTYPE bogus comment state".
        ## NOTE: Unlike spec's "bogus comment state", this implementation
        ## consumes characters one-by-one basis.
        if ($self->{nc} == 0x003E) { # >
+         if ($self->{in_subset}) {
-         $self->{state} = DATA_STATE;
+           $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+         } else {
+           $self->{state} = DATA_STATE;
+           $self->{s_kwd} = '';
+         }
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 1950 
 sub _get_next_token ($) {
+Line 2349 
 sub _get_next_token ($) {
          return  ($self->{ct}); # comment
          redo A;
        } elsif ($self->{nc} == -1) {
+         if ($self->{in_subset}) {
-         $self->{state} = DATA_STATE;
+           $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+         } else {
+           $self->{state} = DATA_STATE;
+           $self->{s_kwd} = '';
+         }
          ## reconsume
          return  ($self->{ct}); # comment
-Line 1978 
 sub _get_next_token ($) {
+Line 2383 
 sub _get_next_token ($) {
          redo A;
        }
      } elsif ($self->{state} == MARKUP_DECLARATION_OPEN_STATE) {
-       ## (only happen if PCDATA state)
+       ## XML5: "Markup declaration state".
        if ($self->{nc} == 0x002D) { # -
-Line 2000 
 sub _get_next_token ($) {
+Line 2405 
 sub _get_next_token ($) {
          ## ASCII case-insensitive.
          $self->{state} = MD_DOCTYPE_STATE;
-         $self->{s_kwd} = chr $self->{nc};
+         $self->{kwd} = chr $self->{nc};
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 2019 
 sub _get_next_token ($) {
+Line 2424 
 sub _get_next_token ($) {
                 $self->{nc} == 0x005B) { # [
          $self->{state} = MD_CDATA_STATE;
-         $self->{s_kwd} = '[';
+         $self->{kwd} = '[';
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 2053 
 sub _get_next_token ($) {
+Line 2458 
 sub _get_next_token ($) {
                                    line => $self->{line_prev},
                                    column => $self->{column_prev} - 2,
                                   };
-         $self->{state} = COMMENT_START_STATE;
+         $self->{state} = COMMENT_START_STATE; ## XML5: "comment state".
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 2089 
 sub _get_next_token ($) {
+Line 2494 
 sub _get_next_token ($) {
 x0054, # T
 x0059, # Y
 x0050, # P
-           ]->[length $self->{s_kwd}] or
+           ]->[length $self->{kwd}] or
            $self->{nc} == [
              undef,
 x006F, # o
-Line 2097 
 sub _get_next_token ($) {
+Line 2502 
 sub _get_next_token ($) {
 x0074, # t
 x0079, # y
 x0070, # p
-           ]->[length $self->{s_kwd}]) {
+           ]->[length $self->{kwd}]) {
          ## Stay in the state.
-         $self->{s_kwd} .= chr $self->{nc};
+         $self->{kwd} .= chr $self->{nc};
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 2113 
 sub _get_next_token ($) {
+Line 2518 
 sub _get_next_token ($) {
      }
          redo A;
-       } elsif ((length $self->{s_kwd}) == 6 and
+       } elsif ((length $self->{kwd}) == 6 and
                 ($self->{nc} == 0x0045 or # E
                  $self->{nc} == 0x0065)) { # e
+         if ($self->{is_xml} and
+             ($self->{kwd} ne 'DOCTYP' or $self->{nc} == 0x0065)) {
+           ## XML5: case-sensitive.
+           $self->{parse_error}->(level => $self->{level}->{must}, type => 'lowercase keyword', ## TODO
+                           text => 'DOCTYPE',
+                           line => $self->{line_prev},
+                           column => $self->{column_prev} - 5);
+         } else {
+         }
          $self->{state} = DOCTYPE_STATE;
          $self->{ct} = {type => DOCTYPE_TOKEN,
                                    quirks => 1,
-Line 2139 
 sub _get_next_token ($) {
+Line 2554 
 sub _get_next_token ($) {
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'bogus comment',
                          line => $self->{line_prev},
-                         column => $self->{column_prev} - 1 - length $self->{s_kwd});
+                         column => $self->{column_prev} - 1 - length $self->{kwd});
          $self->{state} = BOGUS_COMMENT_STATE;
          ## Reconsume.
          $self->{ct} = {type => COMMENT_TOKEN,
-                                   data => $self->{s_kwd},
+                                   data => $self->{kwd},
                                    line => $self->{line_prev},
-                                   column => $self->{column_prev} - 1 - length $self->{s_kwd},
+                                   column => $self->{column_prev} - 1 - length $self->{kwd},
                                   };
          redo A;
        }
-Line 2156 
 sub _get_next_token ($) {
+Line 2571 
 sub _get_next_token ($) {
              '[CD' => 0x0041, # A
              '[CDA' => 0x0054, # T
              '[CDAT' => 0x0041, # A
-           }->{$self->{s_kwd}}) {
+           }->{$self->{kwd}}) {
          ## Stay in the state.
-         $self->{s_kwd} .= chr $self->{nc};
+         $self->{kwd} .= chr $self->{nc};
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 2172 
 sub _get_next_token ($) {
+Line 2587 
 sub _get_next_token ($) {
      }
          redo A;
-       } elsif ($self->{s_kwd} eq '[CDATA' and
+       } elsif ($self->{kwd} eq '[CDATA' and
                 $self->{nc} == 0x005B) { # [
+         if ($self->{is_xml} and
+             not $self->{tainted} and
+             @{$self->{open_elements} or []} == 0) {
+           $self->{parse_error}->(level => $self->{level}->{must}, type => 'cdata outside of root element',
+                           line => $self->{line_prev},
+                           column => $self->{column_prev} - 7);
+           $self->{tainted} = 1;
+         } else {
+         }
          $self->{ct} = {type => CHARACTER_TOKEN,
                                    data => '',
                                    line => $self->{line_prev},
-Line 2196 
 sub _get_next_token ($) {
+Line 2622 
 sub _get_next_token ($) {
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'bogus comment',
                          line => $self->{line_prev},
-                         column => $self->{column_prev} - 1 - length $self->{s_kwd});
+                         column => $self->{column_prev} - 1 - length $self->{kwd});
          $self->{state} = BOGUS_COMMENT_STATE;
          ## Reconsume.
          $self->{ct} = {type => COMMENT_TOKEN,
-                                   data => $self->{s_kwd},
+                                   data => $self->{kwd},
                                    line => $self->{line_prev},
-                                   column => $self->{column_prev} - 1 - length $self->{s_kwd},
+                                   column => $self->{column_prev} - 1 - length $self->{kwd},
                                   };
          redo A;
        }
-Line 2223 
 sub _get_next_token ($) {
+Line 2649 
 sub _get_next_token ($) {
          redo A;
        } elsif ($self->{nc} == 0x003E) { # >
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'bogus comment');
-         $self->{state} = DATA_STATE;
+         if ($self->{in_subset}) {
+           $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+         } else {
+           $self->{state} = DATA_STATE;
+           $self->{s_kwd} = '';
+         }
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 2242 
 sub _get_next_token ($) {
+Line 2674 
 sub _get_next_token ($) {
          redo A;
        } elsif ($self->{nc} == -1) {
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed comment');
-         $self->{state} = DATA_STATE;
+         if ($self->{in_subset}) {
+           $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+         } else {
+           $self->{state} = DATA_STATE;
+           $self->{s_kwd} = '';
+         }
          ## reconsume
          return  ($self->{ct}); # comment
-Line 2285 
 sub _get_next_token ($) {
+Line 2723 
 sub _get_next_token ($) {
          redo A;
        } elsif ($self->{nc} == 0x003E) { # >
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'bogus comment');
-         $self->{state} = DATA_STATE;
+         if ($self->{in_subset}) {
+           $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+         } else {
+           $self->{state} = DATA_STATE;
+           $self->{s_kwd} = '';
+         }
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 2304 
 sub _get_next_token ($) {
+Line 2748 
 sub _get_next_token ($) {
          redo A;
        } elsif ($self->{nc} == -1) {
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed comment');
-         $self->{state} = DATA_STATE;
+         if ($self->{in_subset}) {
+           $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+         } else {
+           $self->{state} = DATA_STATE;
+           $self->{s_kwd} = '';
+         }
          ## reconsume
          return  ($self->{ct}); # comment
-Line 2331 
 sub _get_next_token ($) {
+Line 2781 
 sub _get_next_token ($) {
          redo A;
        }
      } elsif ($self->{state} == COMMENT_STATE) {
+       ## XML5: "Comment state" and "DOCTYPE comment state".
        if ($self->{nc} == 0x002D) { # -
          $self->{state} = COMMENT_END_DASH_STATE;
-Line 2347 
 sub _get_next_token ($) {
+Line 2799 
 sub _get_next_token ($) {
          redo A;
        } elsif ($self->{nc} == -1) {
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed comment');
-         $self->{state} = DATA_STATE;
+         if ($self->{in_subset}) {
+           $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+         } else {
+           $self->{state} = DATA_STATE;
+           $self->{s_kwd} = '';
+         }
          ## reconsume
          return  ($self->{ct}); # comment
-Line 2377 
 sub _get_next_token ($) {
+Line 2835 
 sub _get_next_token ($) {
          redo A;
        }
      } elsif ($self->{state} == COMMENT_END_DASH_STATE) {
+       ## XML5: "Comment dash state" and "DOCTYPE comment dash state".
        if ($self->{nc} == 0x002D) { # -
          $self->{state} = COMMENT_END_STATE;
-Line 2393 
 sub _get_next_token ($) {
+Line 2853 
 sub _get_next_token ($) {
          redo A;
        } elsif ($self->{nc} == -1) {
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed comment');
-         $self->{state} = DATA_STATE;
+         if ($self->{in_subset}) {
+           $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+         } else {
+           $self->{state} = DATA_STATE;
+           $self->{s_kwd} = '';
+         }
          ## reconsume
          return  ($self->{ct}); # comment
-Line 2419 
 sub _get_next_token ($) {
+Line 2885 
 sub _get_next_token ($) {
          redo A;
        }
      } elsif ($self->{state} == COMMENT_END_STATE) {
+       ## XML5: "Comment end state" and "DOCTYPE comment end state".
        if ($self->{nc} == 0x003E) { # >
+         if ($self->{in_subset}) {
-         $self->{state} = DATA_STATE;
+           $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+         } else {
+           $self->{state} = DATA_STATE;
+           $self->{s_kwd} = '';
+         }
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 2439 
 sub _get_next_token ($) {
+Line 2913 
 sub _get_next_token ($) {
          redo A;
        } elsif ($self->{nc} == 0x002D) { # -
+         ## XML5: Not a parse error.
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'dash in comment',
                          line => $self->{line_prev},
                          column => $self->{column_prev});
-Line 2457 
 sub _get_next_token ($) {
+Line 2932 
 sub _get_next_token ($) {
          redo A;
        } elsif ($self->{nc} == -1) {
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed comment');
-         $self->{state} = DATA_STATE;
+         if ($self->{in_subset}) {
+           $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+         } else {
+           $self->{state} = DATA_STATE;
+           $self->{s_kwd} = '';
+         }
          ## reconsume
          return  ($self->{ct}); # comment
-Line 2467 
 sub _get_next_token ($) {
+Line 2948 
 sub _get_next_token ($) {
          redo A;
        } else {
+         ## XML5: Not a parse error.
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'dash in comment',
                          line => $self->{line_prev},
                          column => $self->{column_prev});
-Line 2503 
 sub _get_next_token ($) {
+Line 2985 
 sub _get_next_token ($) {
          redo A;
        } else {
+         ## XML5: Unless EOF, swith to the bogus comment state.
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'no space before DOCTYPE name');
          $self->{state} = BEFORE_DOCTYPE_NAME_STATE;
          ## reconsume
          redo A;
        }
      } elsif ($self->{state} == BEFORE_DOCTYPE_NAME_STATE) {
+       ## XML5: "DOCTYPE root name before state".
        if ($is_space->{$self->{nc}}) {
          ## Stay in the state
-Line 2526 
 sub _get_next_token ($) {
+Line 3011 
 sub _get_next_token ($) {
          redo A;
        } elsif ($self->{nc} == 0x003E) { # >
+         ## XML5: No parse error.
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'no DOCTYPE name');
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 2547 
 sub _get_next_token ($) {
+Line 3034 
 sub _get_next_token ($) {
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'no DOCTYPE name');
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
          ## reconsume
          return  ($self->{ct}); # DOCTYPE (quirks)
          redo A;
+       } elsif ($self->{is_xml} and $self->{nc} == 0x005B) { # [
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'no DOCTYPE name');
+         $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+         $self->{ct}->{has_internal_subset} = 1; # DOCTYPE
+         $self->{in_subset} = 1;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         return  ($self->{ct}); # DOCTYPE
+         redo A;
        } else {
          $self->{ct}->{name} = chr $self->{nc};
-Line 2571 
 sub _get_next_token ($) {
+Line 3078 
 sub _get_next_token ($) {
          redo A;
        }
      } elsif ($self->{state} == DOCTYPE_NAME_STATE) {
- ## ISSUE: Redundant "First," in the spec.
+       ## XML5: "DOCTYPE root name state".
+       ## ISSUE: Redundant "First," in the spec.
        if ($is_space->{$self->{nc}}) {
          $self->{state} = AFTER_DOCTYPE_NAME_STATE;
-Line 2590 
 sub _get_next_token ($) {
+Line 3100 
 sub _get_next_token ($) {
        } elsif ($self->{nc} == 0x003E) { # >
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 2609 
 sub _get_next_token ($) {
+Line 3120 
 sub _get_next_token ($) {
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed DOCTYPE');
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
          ## reconsume
          $self->{ct}->{quirks} = 1;
          return  ($self->{ct}); # DOCTYPE
          redo A;
+       } elsif ($self->{is_xml} and $self->{nc} == 0x005B) { # [
+         $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+         $self->{ct}->{has_internal_subset} = 1; # DOCTYPE
+         $self->{in_subset} = 1;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         return  ($self->{ct}); # DOCTYPE
+         redo A;
        } else {
          $self->{ct}->{name}
-Line 2634 
 sub _get_next_token ($) {
+Line 3164 
 sub _get_next_token ($) {
          redo A;
        }
      } elsif ($self->{state} == AFTER_DOCTYPE_NAME_STATE) {
+       ## XML5: Corresponding to XML5's "DOCTYPE root name after
+       ## state", but implemented differently.
        if ($is_space->{$self->{nc}}) {
          ## Stay in the state
-Line 2650 
 sub _get_next_token ($) {
+Line 3183 
 sub _get_next_token ($) {
          redo A;
        } elsif ($self->{nc} == 0x003E) { # >
+         if ($self->{ct}->{type} == DOCTYPE_TOKEN) {
+           $self->{state} = DATA_STATE;
+           $self->{s_kwd} = '';
+         } else {
+           $self->{parse_error}->(level => $self->{level}->{must}, type => 'no md def'); ## TODO: type
+           $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+         }
-         $self->{state} = DATA_STATE;
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 2663 
 sub _get_next_token ($) {
+Line 3204 
 sub _get_next_token ($) {
        $self->{set_nc}->($self);
      }
+         return  ($self->{ct}); # DOCTYPE/ENTITY/NOTATION
-         return  ($self->{ct}); # DOCTYPE
          redo A;
        } elsif ($self->{nc} == -1) {
+         if ($self->{ct}->{type} == DOCTYPE_TOKEN) {
+           $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed DOCTYPE');
+           $self->{state} = DATA_STATE;
+           $self->{s_kwd} = '';
+           $self->{ct}->{quirks} = 1;
+         } else {
+           $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed md'); ## TODO: type
+           $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+         }
-         $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed DOCTYPE');
+         ## Reconsume.
-         $self->{state} = DATA_STATE;
+         return  ($self->{ct}); # DOCTYPE/ENTITY/NOTATION
-         ## reconsume
-         $self->{ct}->{quirks} = 1;
-         return  ($self->{ct}); # DOCTYPE
          redo A;
        } elsif ($self->{nc} == 0x0050 or # P
                 $self->{nc} == 0x0070) { # p
          $self->{state} = PUBLIC_STATE;
-         $self->{s_kwd} = chr $self->{nc};
+         $self->{kwd} = chr $self->{nc};
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 2695 
 sub _get_next_token ($) {
+Line 3241 
 sub _get_next_token ($) {
          redo A;
        } elsif ($self->{nc} == 0x0053 or # S
                 $self->{nc} == 0x0073) { # s
          $self->{state} = SYSTEM_STATE;
-         $self->{s_kwd} = chr $self->{nc};
+         $self->{kwd} = chr $self->{nc};
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 2709 
 sub _get_next_token ($) {
+Line 3256 
 sub _get_next_token ($) {
      }
          redo A;
-       } else {
+ ## TODO: " and ' for ENTITY
+       } elsif ($self->{is_xml} and
+                $self->{ct}->{type} == DOCTYPE_TOKEN and
+                $self->{nc} == 0x005B) { # [
-         $self->{parse_error}->(level => $self->{level}->{must}, type => 'string after DOCTYPE name');
+         $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
-         $self->{ct}->{quirks} = 1;
+         $self->{ct}->{has_internal_subset} = 1; # DOCTYPE
+         $self->{in_subset} = 1;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         return  ($self->{ct}); # DOCTYPE
+         redo A;
+       } else {
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'string after DOCTYPE name'); ## TODO: type
+         if ($self->{ct}->{type} == DOCTYPE_TOKEN) {
+           $self->{ct}->{quirks} = 1;
+           $self->{state} = BOGUS_DOCTYPE_STATE;
+         } else {
+           $self->{state} = BOGUS_MD_STATE;
+         }
-         $self->{state} = BOGUS_DOCTYPE_STATE;
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 2736 
 sub _get_next_token ($) {
+Line 3310 
 sub _get_next_token ($) {
 x0042, # B
 x004C, # L
 x0049, # I
-           ]->[length $self->{s_kwd}] or
+           ]->[length $self->{kwd}] or
            $self->{nc} == [
              undef,
 x0075, # u
 x0062, # b
 x006C, # l
 x0069, # i
-           ]->[length $self->{s_kwd}]) {
+           ]->[length $self->{kwd}]) {
          ## Stay in the state.
-         $self->{s_kwd} .= chr $self->{nc};
+         $self->{kwd} .= chr $self->{nc};
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 2759 
 sub _get_next_token ($) {
+Line 3333 
 sub _get_next_token ($) {
      }
          redo A;
-       } elsif ((length $self->{s_kwd}) == 5 and
+       } elsif ((length $self->{kwd}) == 5 and
                 ($self->{nc} == 0x0043 or # C
                  $self->{nc} == 0x0063)) { # c
+         if ($self->{is_xml} and
+             ($self->{kwd} ne 'PUBLI' or $self->{nc} == 0x0063)) { # c
+           $self->{parse_error}->(level => $self->{level}->{must}, type => 'lowercase keyword', ## TODO: type
+                           text => 'PUBLIC',
+                           line => $self->{line_prev},
+                           column => $self->{column_prev} - 4);
+         } else {
+         }
          $self->{state} = BEFORE_DOCTYPE_PUBLIC_IDENTIFIER_STATE;
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
-Line 2777 
 sub _get_next_token ($) {
+Line 3360 
 sub _get_next_token ($) {
          redo A;
        } else {
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'string after DOCTYPE name', ## TODO: type
-         $self->{parse_error}->(level => $self->{level}->{must}, type => 'string after DOCTYPE name',
                          line => $self->{line_prev},
-                         column => $self->{column_prev} + 1 - length $self->{s_kwd});
+                         column => $self->{column_prev} + 1 - length $self->{kwd});
-         $self->{ct}->{quirks} = 1;
+         if ($self->{ct}->{type} == DOCTYPE_TOKEN) {
-         $self->{state} = BOGUS_DOCTYPE_STATE;
+           $self->{ct}->{quirks} = 1;
+           $self->{state} = BOGUS_DOCTYPE_STATE;
+         } else {
+           $self->{state} = BOGUS_MD_STATE;
+         }
          ## Reconsume.
          redo A;
        }
-Line 2795 
 sub _get_next_token ($) {
+Line 3382 
 sub _get_next_token ($) {
 x0053, # S
 x0054, # T
 x0045, # E
-           ]->[length $self->{s_kwd}] or
+           ]->[length $self->{kwd}] or
            $self->{nc} == [
              undef,
 x0079, # y
 x0073, # s
 x0074, # t
 x0065, # e
-           ]->[length $self->{s_kwd}]) {
+           ]->[length $self->{kwd}]) {
          ## Stay in the state.
-         $self->{s_kwd} .= chr $self->{nc};
+         $self->{kwd} .= chr $self->{nc};
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 2818 
 sub _get_next_token ($) {
+Line 3405 
 sub _get_next_token ($) {
      }
          redo A;
-       } elsif ((length $self->{s_kwd}) == 5 and
+       } elsif ((length $self->{kwd}) == 5 and
                 ($self->{nc} == 0x004D or # M
                  $self->{nc} == 0x006D)) { # m
+         if ($self->{is_xml} and
+             ($self->{kwd} ne 'SYSTE' or $self->{nc} == 0x006D)) { # m
+           $self->{parse_error}->(level => $self->{level}->{must}, type => 'lowercase keyword', ## TODO: type
+                           text => 'SYSTEM',
+                           line => $self->{line_prev},
+                           column => $self->{column_prev} - 4);
+         } else {
+         }
          $self->{state} = BEFORE_DOCTYPE_SYSTEM_IDENTIFIER_STATE;
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
-Line 2836 
 sub _get_next_token ($) {
+Line 3432 
 sub _get_next_token ($) {
          redo A;
        } else {
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'string after DOCTYPE name', ## TODO: type
-         $self->{parse_error}->(level => $self->{level}->{must}, type => 'string after DOCTYPE name',
                          line => $self->{line_prev},
-                         column => $self->{column_prev} + 1 - length $self->{s_kwd});
+                         column => $self->{column_prev} + 1 - length $self->{kwd});
-         $self->{ct}->{quirks} = 1;
+         if ($self->{ct}->{type} == DOCTYPE_TOKEN) {
-         $self->{state} = BOGUS_DOCTYPE_STATE;
+           $self->{ct}->{quirks} = 1;
+           $self->{state} = BOGUS_DOCTYPE_STATE;
+         } else {
+           $self->{state} = BOGUS_MD_STATE;
+         }
          ## Reconsume.
          redo A;
        }
-Line 2895 
 sub _get_next_token ($) {
+Line 3495 
 sub _get_next_token ($) {
          redo A;
        } elsif ($self->{nc} eq 0x003E) { # >
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'no PUBLIC literal');
-         $self->{state} = DATA_STATE;
+         if ($self->{ct}->{type} == DOCTYPE_TOKEN) {
+           $self->{state} = DATA_STATE;
+           $self->{s_kwd} = '';
+           $self->{ct}->{quirks} = 1;
+         } else {
+           $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+         }
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 2910 
 sub _get_next_token ($) {
+Line 3518 
 sub _get_next_token ($) {
        $self->{set_nc}->($self);
      }
+         return  ($self->{ct}); # DOCTYPE/ENTITY/NOTATION
-         $self->{ct}->{quirks} = 1;
-         return  ($self->{ct}); # DOCTYPE
          redo A;
        } elsif ($self->{nc} == -1) {
+         if ($self->{ct}->{type} == DOCTYPE_TOKEN) {
+           $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed DOCTYPE');
+           $self->{state} = DATA_STATE;
+           $self->{s_kwd} = '';
+           $self->{ct}->{quirks} = 1;
+         } else {
+           $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed md'); ## TODO: type
+           $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+         }
-         $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed DOCTYPE');
-         $self->{state} = DATA_STATE;
          ## reconsume
-         $self->{ct}->{quirks} = 1;
          return  ($self->{ct}); # DOCTYPE
          redo A;
-       } else {
+       } elsif ($self->{is_xml} and
+                $self->{ct}->{type} == DOCTYPE_TOKEN and
+                $self->{nc} == 0x005B) { # [
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'no PUBLIC literal');
+         $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+         $self->{ct}->{has_internal_subset} = 1; # DOCTYPE
+         $self->{in_subset} = 1;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         return  ($self->{ct}); # DOCTYPE
+         redo A;
+       } else {
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'string after PUBLIC');
-         $self->{ct}->{quirks} = 1;
-         $self->{state} = BOGUS_DOCTYPE_STATE;
+         if ($self->{ct}->{type} == DOCTYPE_TOKEN) {
+           $self->{ct}->{quirks} = 1;
+           $self->{state} = BOGUS_DOCTYPE_STATE;
+         } else {
+           $self->{state} = BOGUS_MD_STATE;
+         }
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 2962 
 sub _get_next_token ($) {
+Line 3599 
 sub _get_next_token ($) {
          redo A;
        } elsif ($self->{nc} == 0x003E) { # >
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed PUBLIC literal');
-         $self->{state} = DATA_STATE;
+         if ($self->{ct}->{type} == DOCTYPE_TOKEN) {
+           $self->{state} = DATA_STATE;
+           $self->{s_kwd} = '';
+           $self->{ct}->{quirks} = 1;
+         } else {
+           $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+         }
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 2977 
 sub _get_next_token ($) {
+Line 3622 
 sub _get_next_token ($) {
        $self->{set_nc}->($self);
      }
+         return  ($self->{ct}); # DOCTYPE/ENTITY/NOTATION
-         $self->{ct}->{quirks} = 1;
-         return  ($self->{ct}); # DOCTYPE
          redo A;
        } elsif ($self->{nc} == -1) {
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed PUBLIC literal');
-         $self->{state} = DATA_STATE;
+         if ($self->{ct}->{type} == DOCTYPE_TOKEN) {
-         ## reconsume
+           $self->{state} = DATA_STATE;
-         $self->{ct}->{quirks} = 1;
+           $self->{s_kwd} = '';
+           $self->{ct}->{quirks} = 1;
+         } else {
+           $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+         }
+         ## Reconsume.
          return  ($self->{ct}); # DOCTYPE
          redo A;
        } else {
-         $self->{ct}->{pubid} # DOCTYPE
+         $self->{ct}->{pubid} .= chr $self->{nc}; # DOCTYPE/ENTITY/NOTATION
-             .= chr $self->{nc};
          $self->{read_until}->($self->{ct}->{pubid}, q[">],
                                length $self->{ct}->{pubid});
-Line 3031 
 sub _get_next_token ($) {
+Line 3677 
 sub _get_next_token ($) {
          redo A;
        } elsif ($self->{nc} == 0x003E) { # >
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed PUBLIC literal');
-         $self->{state} = DATA_STATE;
+         if ($self->{ct}->{type} == DOCTYPE_TOKEN) {
+           $self->{state} = DATA_STATE;
+           $self->{s_kwd} = '';
+           $self->{ct}->{quirks} = 1;
+         } else {
+           $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+         }
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 3046 
 sub _get_next_token ($) {
+Line 3700 
 sub _get_next_token ($) {
        $self->{set_nc}->($self);
      }
+         return  ($self->{ct}); # DOCTYPE/ENTITY/NOTATION
-         $self->{ct}->{quirks} = 1;
-         return  ($self->{ct}); # DOCTYPE
          redo A;
        } elsif ($self->{nc} == -1) {
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed PUBLIC literal');
-         $self->{state} = DATA_STATE;
+         if ($self->{ct}->{type} == DOCTYPE_TOKEN) {
+           $self->{state} = DATA_STATE;
+           $self->{s_kwd} = '';
+           $self->{ct}->{quirks} = 1;
+         } else {
+           $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+         }
          ## reconsume
+         return  ($self->{ct}); # DOCTYPE/ENTITY/NOTATION
-         $self->{ct}->{quirks} = 1;
-         return  ($self->{ct}); # DOCTYPE
          redo A;
        } else {
-         $self->{ct}->{pubid} # DOCTYPE
+         $self->{ct}->{pubid} .= chr $self->{nc}; # DOCTYPE/ENTITY/NOTATION
-             .= chr $self->{nc};
          $self->{read_until}->($self->{ct}->{pubid}, q['>],
                                length $self->{ct}->{pubid});
-Line 3101 
 sub _get_next_token ($) {
+Line 3756 
 sub _get_next_token ($) {
          redo A;
        } elsif ($self->{nc} == 0x0022) { # "
-         $self->{ct}->{sysid} = ''; # DOCTYPE
+         $self->{ct}->{sysid} = ''; # DOCTYPE/ENTITY/NOTATION
          $self->{state} = DOCTYPE_SYSTEM_IDENTIFIER_DOUBLE_QUOTED_STATE;
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
-Line 3117 
 sub _get_next_token ($) {
+Line 3772 
 sub _get_next_token ($) {
          redo A;
        } elsif ($self->{nc} == 0x0027) { # '
-         $self->{ct}->{sysid} = ''; # DOCTYPE
+         $self->{ct}->{sysid} = ''; # DOCTYPE/ENTITY/NOTATION
          $self->{state} = DOCTYPE_SYSTEM_IDENTIFIER_SINGLE_QUOTED_STATE;
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
-Line 3132 
 sub _get_next_token ($) {
+Line 3787 
 sub _get_next_token ($) {
          redo A;
        } elsif ($self->{nc} == 0x003E) { # >
+         if ($self->{ct}->{type} == DOCTYPE_TOKEN) {
+           if ($self->{is_xml}) {
+             $self->{parse_error}->(level => $self->{level}->{must}, type => 'no SYSTEM literal');
+           } else {
+           }
+           $self->{state} = DATA_STATE;
+           $self->{s_kwd} = '';
+         } else {
+           if ($self->{ct}->{type} == NOTATION_TOKEN) {
+           } else {
+             $self->{parse_error}->(level => $self->{level}->{must}, type => 'no SYSTEM literal');
+           }
+           $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+         }
-         $self->{state} = DATA_STATE;
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 3145 
 sub _get_next_token ($) {
+Line 3817 
 sub _get_next_token ($) {
        $self->{set_nc}->($self);
      }
+         return  ($self->{ct}); # DOCTYPE/ENTITY/NOTATION
-         return  ($self->{ct}); # DOCTYPE
          redo A;
        } elsif ($self->{nc} == -1) {
+         if ($self->{ct}->{type} == DOCTYPE_TOKEN) {
+           $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed DOCTYPE');
+           $self->{state} = DATA_STATE;
+           $self->{s_kwd} = '';
+           $self->{ct}->{quirks} = 1;
+         } else {
+           $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed md'); ## TODO: type
+           $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+         }
-         $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed DOCTYPE');
-         $self->{state} = DATA_STATE;
          ## reconsume
+         return  ($self->{ct}); # DOCTYPE/ENTITY/NOTATION
-         $self->{ct}->{quirks} = 1;
+         redo A;
+       } elsif ($self->{is_xml} and
+                $self->{ct}->{type} == DOCTYPE_TOKEN and
+                $self->{nc} == 0x005B) { # [
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'no SYSTEM literal');
+         $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+         $self->{ct}->{has_internal_subset} = 1; # DOCTYPE
+         $self->{in_subset} = 1;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
          return  ($self->{ct}); # DOCTYPE
          redo A;
        } else {
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'string after PUBLIC literal');
-         $self->{ct}->{quirks} = 1;
-         $self->{state} = BOGUS_DOCTYPE_STATE;
+         if ($self->{ct}->{type} == DOCTYPE_TOKEN) {
+           $self->{ct}->{quirks} = 1;
+           $self->{state} = BOGUS_DOCTYPE_STATE;
+         } else {
+           $self->{state} = BOGUS_MD_STATE;
+         }
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 3228 
 sub _get_next_token ($) {
+Line 3930 
 sub _get_next_token ($) {
          redo A;
        } elsif ($self->{nc} == 0x003E) { # >
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'no SYSTEM literal');
-         $self->{state} = DATA_STATE;
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 3243 
 sub _get_next_token ($) {
+Line 3943 
 sub _get_next_token ($) {
      }
-         $self->{ct}->{quirks} = 1;
+         if ($self->{ct}->{type} == DOCTYPE_TOKEN) {
-         return  ($self->{ct}); # DOCTYPE
+           $self->{state} = DATA_STATE;
+           $self->{s_kwd} = '';
+           $self->{ct}->{quirks} = 1;
+         } else {
+           $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+         }
+         return  ($self->{ct}); # DOCTYPE/ENTITY/NOTATION
          redo A;
        } elsif ($self->{nc} == -1) {
+         if ($self->{ct}->{type} == DOCTYPE_TOKEN) {
+           $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed DOCTYPE');
+           $self->{state} = DATA_STATE;
+           $self->{s_kwd} = '';
+           $self->{ct}->{quirks} = 1;
+         } else {
+           $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed md'); ## TODO: type
+           $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+         }
-         $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed DOCTYPE');
-         $self->{state} = DATA_STATE;
          ## reconsume
+         return  ($self->{ct}); # DOCTYPE/ENTITY/NOTATION
+         redo A;
+       } elsif ($self->{is_xml} and
+                $self->{ct}->{type} == DOCTYPE_TOKEN and
+                $self->{nc} == 0x005B) { # [
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'no SYSTEM literal');
-         $self->{ct}->{quirks} = 1;
+         $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+         $self->{ct}->{has_internal_subset} = 1; # DOCTYPE
+         $self->{in_subset} = 1;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
          return  ($self->{ct}); # DOCTYPE
          redo A;
        } else {
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'string after SYSTEM');
-         $self->{ct}->{quirks} = 1;
-         $self->{state} = BOGUS_DOCTYPE_STATE;
+         if ($self->{ct}->{type} == DOCTYPE_TOKEN) {
+           $self->{ct}->{quirks} = 1;
+           $self->{state} = BOGUS_DOCTYPE_STATE;
+         } else {
+           $self->{state} = BOGUS_MD_STATE;
+         }
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 3293 
 sub _get_next_token ($) {
+Line 4034 
 sub _get_next_token ($) {
      }
          redo A;
-       } elsif ($self->{nc} == 0x003E) { # >
+       } elsif (not $self->{is_xml} and $self->{nc} == 0x003E) { # >
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed SYSTEM literal');
-         $self->{state} = DATA_STATE;
+         if ($self->{ct}->{type} == DOCTYPE_TOKEN) {
+           $self->{state} = DATA_STATE;
+           $self->{s_kwd} = '';
+           $self->{ct}->{quirks} = 1;
+         } else {
+           $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+         }
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 3309 
 sub _get_next_token ($) {
+Line 4058 
 sub _get_next_token ($) {
        $self->{set_nc}->($self);
      }
+         return  ($self->{ct}); # DOCTYPE/ENTITY/NOTATION
-         $self->{ct}->{quirks} = 1;
-         return  ($self->{ct}); # DOCTYPE
          redo A;
        } elsif ($self->{nc} == -1) {
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed SYSTEM literal');
-         $self->{state} = DATA_STATE;
+         if ($self->{ct}->{type} == DOCTYPE_TOKEN) {
+           $self->{state} = DATA_STATE;
+           $self->{s_kwd} = '';
+           $self->{ct}->{quirks} = 1;
+         } else {
+           $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+         }
          ## reconsume
+         return  ($self->{ct}); # DOCTYPE/ENTITY/NOTATION
-         $self->{ct}->{quirks} = 1;
-         return  ($self->{ct}); # DOCTYPE
          redo A;
        } else {
-         $self->{ct}->{sysid} # DOCTYPE
+         $self->{ct}->{sysid} .= chr $self->{nc}; # DOCTYPE/ENTITY/NOTATION
-             .= chr $self->{nc};
          $self->{read_until}->($self->{ct}->{sysid}, q[">],
                                length $self->{ct}->{sysid});
-Line 3362 
 sub _get_next_token ($) {
+Line 4112 
 sub _get_next_token ($) {
      }
          redo A;
-       } elsif ($self->{nc} == 0x003E) { # >
+       } elsif (not $self->{is_xml} and $self->{nc} == 0x003E) { # >
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed SYSTEM literal');
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 3384 
 sub _get_next_token ($) {
+Line 4135 
 sub _get_next_token ($) {
          redo A;
        } elsif ($self->{nc} == -1) {
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed SYSTEM literal');
-         $self->{state} = DATA_STATE;
+         if ($self->{ct}->{type} == DOCTYPE_TOKEN) {
-         ## reconsume
+           $self->{state} = DATA_STATE;
-         $self->{ct}->{quirks} = 1;
+           $self->{s_kwd} = '';
-         return  ($self->{ct}); # DOCTYPE
+           $self->{ct}->{quirks} = 1;
+         } else {
+           $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+         }
+         ## reconsume
+         return  ($self->{ct}); # DOCTYPE/ENTITY/NOTATION
          redo A;
        } else {
-         $self->{ct}->{sysid} # DOCTYPE
+         $self->{ct}->{sysid} .= chr $self->{nc}; # DOCTYPE/ENTITY/NOTATION
-             .= chr $self->{nc};
          $self->{read_until}->($self->{ct}->{sysid}, q['>],
                                length $self->{ct}->{sysid});
-Line 3432 
 sub _get_next_token ($) {
+Line 4187 
 sub _get_next_token ($) {
          redo A;
        } elsif ($self->{nc} == 0x003E) { # >
+         if ($self->{ct}->{type} == DOCTYPE_TOKEN) {
-         $self->{state} = DATA_STATE;
+           $self->{state} = DATA_STATE;
+           $self->{s_kwd} = '';
+         } else {
+           $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+         }
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 3445 
 sub _get_next_token ($) {
+Line 4207 
 sub _get_next_token ($) {
        $self->{set_nc}->($self);
      }
+         return  ($self->{ct}); # DOCTYPE/ENTITY/NOTATION
-         return  ($self->{ct}); # DOCTYPE
          redo A;
+ ## TODO: "NDATA"
        } elsif ($self->{nc} == -1) {
+         if ($self->{ct}->{type} == DOCTYPE_TOKEN) {
-         $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed DOCTYPE');
-         $self->{state} = DATA_STATE;
+           $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed DOCTYPE');
-         ## reconsume
+           $self->{state} = DATA_STATE;
+           $self->{s_kwd} = '';
+           $self->{ct}->{quirks} = 1;
+         } else {
+           $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed md'); ## TODO: type
+           $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+         }
-         $self->{ct}->{quirks} = 1;
+         ## reconsume
+         return  ($self->{ct}); # DOCTYPE/ENTITY/NOTATION
+         redo A;
+       } elsif ($self->{is_xml} and
+                $self->{ct}->{type} == DOCTYPE_TOKEN and
+                $self->{nc} == 0x005B) { # [
+         $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+         $self->{ct}->{has_internal_subset} = 1; # DOCTYPE
+         $self->{in_subset} = 1;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
          return  ($self->{ct}); # DOCTYPE
          redo A;
        } else {
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'string after SYSTEM literal');
-         #$self->{ct}->{quirks} = 1;
-         $self->{state} = BOGUS_DOCTYPE_STATE;
+         if ($self->{ct}->{type} == DOCTYPE_TOKEN) {
+           #$self->{ct}->{quirks} = 1;
+           $self->{state} = BOGUS_DOCTYPE_STATE;
+         } else {
+           $self->{state} = BOGUS_MD_STATE;
+         }
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 3482 
 sub _get_next_token ($) {
+Line 4275 
 sub _get_next_token ($) {
        if ($self->{nc} == 0x003E) { # >
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 3497 
 sub _get_next_token ($) {
+Line 4291 
 sub _get_next_token ($) {
          return  ($self->{ct}); # DOCTYPE
          redo A;
+       } elsif ($self->{is_xml} and $self->{nc} == 0x005B) { # [
+         $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+         $self->{ct}->{has_internal_subset} = 1; # DOCTYPE
+         $self->{in_subset} = 1;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         return  ($self->{ct}); # DOCTYPE
+         redo A;
        } elsif ($self->{nc} == -1) {
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
          ## reconsume
          return  ($self->{ct}); # DOCTYPE
-Line 3508 
 sub _get_next_token ($) {
+Line 4321 
 sub _get_next_token ($) {
        } else {
          my $s = '';
-         $self->{read_until}->($s, q[>], 0);
+         $self->{read_until}->($s, q{>[}, 0);
          ## Stay in the state
-Line 3528 
 sub _get_next_token ($) {
+Line 4341 
 sub _get_next_token ($) {
        ## NOTE: "CDATA section state" in the state is jointly implemented
        ## by three states, |CDATA_SECTION_STATE|, |CDATA_SECTION_MSE1_STATE|,
        ## and |CDATA_SECTION_MSE2_STATE|.
+       ## XML5: "CDATA state".
        if ($self->{nc} == 0x005D) { # ]
-Line 3545 
 sub _get_next_token ($) {
+Line 4360 
 sub _get_next_token ($) {
          redo A;
        } elsif ($self->{nc} == -1) {
+         if ($self->{is_xml}) {
+           $self->{parse_error}->(level => $self->{level}->{must}, type => 'no mse'); ## TODO: type
+         } else {
+         }
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
-     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+         ## Reconsume.
-       $self->{line_prev} = $self->{line};
-       $self->{column_prev} = $self->{column};
-       $self->{column}++;
-       $self->{nc}
-           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
-     } else {
-       $self->{set_nc}->($self);
-     }
          if (length $self->{ct}->{data}) { # character
            return  ($self->{ct}); # character
-Line 3589 
 sub _get_next_token ($) {
+Line 4402 
 sub _get_next_token ($) {
        ## ISSUE: "text tokens" in spec.
      } elsif ($self->{state} == CDATA_SECTION_MSE1_STATE) {
+       ## XML5: "CDATA bracket state".
        if ($self->{nc} == 0x005D) { # ]
          $self->{state} = CDATA_SECTION_MSE2_STATE;
-Line 3606 
 sub _get_next_token ($) {
+Line 4421 
 sub _get_next_token ($) {
          redo A;
        } else {
+         ## XML5: If EOF, "]" is not appended and changed to the data state.
          $self->{ct}->{data} .= ']';
-         $self->{state} = CDATA_SECTION_STATE;
+         $self->{state} = CDATA_SECTION_STATE; ## XML5: Stay in the state.
          ## Reconsume.
          redo A;
        }
      } elsif ($self->{state} == CDATA_SECTION_MSE2_STATE) {
+       ## XML5: "CDATA end state".
        if ($self->{nc} == 0x003E) { # >
          $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 3653 
 sub _get_next_token ($) {
+Line 4472 
 sub _get_next_token ($) {
          $self->{ct}->{data} .= ']]'; # character
          $self->{state} = CDATA_SECTION_STATE;
-         ## Reconsume.
+         ## Reconsume. ## XML5: Emit.
          redo A;
        }
      } elsif ($self->{state} == ENTITY_STATE) {
-Line 3670 
 sub _get_next_token ($) {
+Line 4489 
 sub _get_next_token ($) {
        } elsif ($self->{nc} == 0x0023) { # #
          $self->{state} = ENTITY_HASH_STATE;
-         $self->{s_kwd} = '#';
+         $self->{kwd} = '#';
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 3690 
 sub _get_next_token ($) {
+Line 4509 
 sub _get_next_token ($) {
          require Whatpm::_NamedEntityList;
          $self->{state} = ENTITY_NAME_STATE;
-         $self->{s_kwd} = chr $self->{nc};
+         $self->{kwd} = chr $self->{nc};
-         $self->{entity__value} = $self->{s_kwd};
+         $self->{entity__value} = $self->{kwd};
          $self->{entity__match} = 0;
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
-Line 3721 
 sub _get_next_token ($) {
+Line 4540 
 sub _get_next_token ($) {
        if ($self->{prev_state} == DATA_STATE) {
          $self->{state} = $self->{prev_state};
+         $self->{s_kwd} = '';
          ## Reconsume.
          return  ({type => CHARACTER_TOKEN, data => '&',
                    line => $self->{line_prev},
-Line 3731 
 sub _get_next_token ($) {
+Line 4551 
 sub _get_next_token ($) {
          $self->{ca}->{value} .= '&';
          $self->{state} = $self->{prev_state};
+         $self->{s_kwd} = '';
          ## Reconsume.
          redo A;
        }
-Line 3739 
 sub _get_next_token ($) {
+Line 4560 
 sub _get_next_token ($) {
            $self->{nc} == 0x0058) { # X
          $self->{state} = HEXREF_X_STATE;
-         $self->{s_kwd} .= chr $self->{nc};
+         $self->{kwd} .= chr $self->{nc};
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 3756 
 sub _get_next_token ($) {
+Line 4577 
 sub _get_next_token ($) {
                 $self->{nc} <= 0x0039) { # 0..9
          $self->{state} = NCR_NUM_STATE;
-         $self->{s_kwd} = $self->{nc} - 0x0030;
+         $self->{kwd} = $self->{nc} - 0x0030;
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
        $self->{line_prev} = $self->{line};
-Line 3781 
 sub _get_next_token ($) {
+Line 4602 
 sub _get_next_token ($) {
          if ($self->{prev_state} == DATA_STATE) {
            $self->{state} = $self->{prev_state};
+           $self->{s_kwd} = '';
            ## Reconsume.
            return  ({type => CHARACTER_TOKEN,
                      data => '&#',
-Line 3792 
 sub _get_next_token ($) {
+Line 4614 
 sub _get_next_token ($) {
            $self->{ca}->{value} .= '&#';
            $self->{state} = $self->{prev_state};
+           $self->{s_kwd} = '';
            ## Reconsume.
            redo A;
          }
-Line 3800 
 sub _get_next_token ($) {
+Line 4623 
 sub _get_next_token ($) {
        if (0x0030 <= $self->{nc} and
            $self->{nc} <= 0x0039) { # 0..9
-         $self->{s_kwd} *= 10;
+         $self->{kwd} *= 10;
-         $self->{s_kwd} += $self->{nc} - 0x0030;
+         $self->{kwd} += $self->{nc} - 0x0030;
          ## Stay in the state.
-Line 3837 
 sub _get_next_token ($) {
+Line 4660 
 sub _get_next_token ($) {
          #
        }
-       my $code = $self->{s_kwd};
+       my $code = $self->{kwd};
        my $l = $self->{line_prev};
        my $c = $self->{column_prev};
        if ($charref_map->{$code}) {
-Line 3857 
 sub _get_next_token ($) {
+Line 4680 
 sub _get_next_token ($) {
        if ($self->{prev_state} == DATA_STATE) {
          $self->{state} = $self->{prev_state};
+         $self->{s_kwd} = '';
          ## Reconsume.
          return  ({type => CHARACTER_TOKEN, data => chr $code,
+                   has_reference => 1,
                    line => $l, column => $c,
                   });
          redo A;
-Line 3867 
 sub _get_next_token ($) {
+Line 4692 
 sub _get_next_token ($) {
          $self->{ca}->{value} .= chr $code;
          $self->{ca}->{has_reference} = 1;
          $self->{state} = $self->{prev_state};
+         $self->{s_kwd} = '';
          ## Reconsume.
          redo A;
        }
-Line 3877 
 sub _get_next_token ($) {
+Line 4703 
 sub _get_next_token ($) {
          # 0..9, A..F, a..f
          $self->{state} = HEXREF_HEX_STATE;
-         $self->{s_kwd} = 0;
+         $self->{kwd} = 0;
          ## Reconsume.
          redo A;
        } else {
-Line 3892 
 sub _get_next_token ($) {
+Line 4718 
 sub _get_next_token ($) {
          if ($self->{prev_state} == DATA_STATE) {
            $self->{state} = $self->{prev_state};
+           $self->{s_kwd} = '';
            ## Reconsume.
            return  ({type => CHARACTER_TOKEN,
-                     data => '&' . $self->{s_kwd},
+                     data => '&' . $self->{kwd},
                      line => $self->{line_prev},
-                     column => $self->{column_prev} - length $self->{s_kwd},
+                     column => $self->{column_prev} - length $self->{kwd},
                     });
            redo A;
          } else {
-           $self->{ca}->{value} .= '&' . $self->{s_kwd};
+           $self->{ca}->{value} .= '&' . $self->{kwd};
            $self->{state} = $self->{prev_state};
+           $self->{s_kwd} = '';
            ## Reconsume.
            redo A;
          }
-Line 3911 
 sub _get_next_token ($) {
+Line 4739 
 sub _get_next_token ($) {
        if (0x0030 <= $self->{nc} and $self->{nc} <= 0x0039) {
          # 0..9
-         $self->{s_kwd} *= 0x10;
+         $self->{kwd} *= 0x10;
-         $self->{s_kwd} += $self->{nc} - 0x0030;
+         $self->{kwd} += $self->{nc} - 0x0030;
          ## Stay in the state.
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
-Line 3929 
 sub _get_next_token ($) {
+Line 4757 
 sub _get_next_token ($) {
        } elsif (0x0061 <= $self->{nc} and
                 $self->{nc} <= 0x0066) { # a..f
-         $self->{s_kwd} *= 0x10;
+         $self->{kwd} *= 0x10;
-         $self->{s_kwd} += $self->{nc} - 0x0060 + 9;
+         $self->{kwd} += $self->{nc} - 0x0060 + 9;
          ## Stay in the state.
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
-Line 3947 
 sub _get_next_token ($) {
+Line 4775 
 sub _get_next_token ($) {
        } elsif (0x0041 <= $self->{nc} and
                 $self->{nc} <= 0x0046) { # A..F
-         $self->{s_kwd} *= 0x10;
+         $self->{kwd} *= 0x10;
-         $self->{s_kwd} += $self->{nc} - 0x0040 + 9;
+         $self->{kwd} += $self->{nc} - 0x0040 + 9;
          ## Stay in the state.
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
-Line 3985 
 sub _get_next_token ($) {
+Line 4813 
 sub _get_next_token ($) {
          #
        }
-       my $code = $self->{s_kwd};
+       my $code = $self->{kwd};
        my $l = $self->{line_prev};
        my $c = $self->{column_prev};
        if ($charref_map->{$code}) {
-Line 4005 
 sub _get_next_token ($) {
+Line 4833 
 sub _get_next_token ($) {
        if ($self->{prev_state} == DATA_STATE) {
          $self->{state} = $self->{prev_state};
+         $self->{s_kwd} = '';
          ## Reconsume.
          return  ({type => CHARACTER_TOKEN, data => chr $code,
+                   has_reference => 1,
                    line => $l, column => $c,
                   });
          redo A;
-Line 4015 
 sub _get_next_token ($) {
+Line 4845 
 sub _get_next_token ($) {
          $self->{ca}->{value} .= chr $code;
          $self->{ca}->{has_reference} = 1;
          $self->{state} = $self->{prev_state};
+         $self->{s_kwd} = '';
          ## Reconsume.
          redo A;
        }
      } elsif ($self->{state} == ENTITY_NAME_STATE) {
-       if (length $self->{s_kwd} < 30 and
+       if (length $self->{kwd} < 30 and
            ## NOTE: Some number greater than the maximum length of entity name
            ((0x0041 <= $self->{nc} and # a
              $self->{nc} <= 0x005A) or # x
-Line 4029 
 sub _get_next_token ($) {
+Line 4860 
 sub _get_next_token ($) {
              $self->{nc} <= 0x0039) or # 9
             $self->{nc} == 0x003B)) { # ;
          our $EntityChar;
-         $self->{s_kwd} .= chr $self->{nc};
+         $self->{kwd} .= chr $self->{nc};
-         if (defined $EntityChar->{$self->{s_kwd}}) {
+         if (defined $EntityChar->{$self->{kwd}}) {
            if ($self->{nc} == 0x003B) { # ;
-             $self->{entity__value} = $EntityChar->{$self->{s_kwd}};
+             $self->{entity__value} = $EntityChar->{$self->{kwd}};
              $self->{entity__match} = 1;
      if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
-Line 4049 
 sub _get_next_token ($) {
+Line 4880 
 sub _get_next_token ($) {
              #
            } else {
-             $self->{entity__value} = $EntityChar->{$self->{s_kwd}};
+             $self->{entity__value} = $EntityChar->{$self->{kwd}};
              $self->{entity__match} = -1;
              ## Stay in the state.
-Line 4097 
 sub _get_next_token ($) {
+Line 4928 
 sub _get_next_token ($) {
          if ($self->{prev_state} != DATA_STATE and # in attribute
              $self->{entity__match} < -1) {
-           $data = '&' . $self->{s_kwd};
+           $data = '&' . $self->{kwd};
            #
          } else {
-Line 4109 
 sub _get_next_token ($) {
+Line 4940 
 sub _get_next_token ($) {
          $self->{parse_error}->(level => $self->{level}->{must}, type => 'bare ero',
                          line => $self->{line_prev},
-                         column => $self->{column_prev} - length $self->{s_kwd});
+                         column => $self->{column_prev} - length $self->{kwd});
-         $data = '&' . $self->{s_kwd};
+         $data = '&' . $self->{kwd};
          #
        }
-Line 4127 
 sub _get_next_token ($) {
+Line 4958 
 sub _get_next_token ($) {
        if ($self->{prev_state} == DATA_STATE) {
          $self->{state} = $self->{prev_state};
+         $self->{s_kwd} = '';
          ## Reconsume.
          return  ({type => CHARACTER_TOKEN,
                    data => $data,
+                   has_reference => $has_ref,
                    line => $self->{line_prev},
-                   column => $self->{column_prev} + 1 - length $self->{s_kwd},
+                   column => $self->{column_prev} + 1 - length $self->{kwd},
                   });
          redo A;
        } else {
-Line 4139 
 sub _get_next_token ($) {
+Line 4972 
 sub _get_next_token ($) {
          $self->{ca}->{value} .= $data;
          $self->{ca}->{has_reference} = 1 if $has_ref;
          $self->{state} = $self->{prev_state};
+         $self->{s_kwd} = '';
+         ## Reconsume.
+         redo A;
+       }
+     ## XML-only states
+     } elsif ($self->{state} == PI_STATE) {
+       ## XML5: "Pi state" and "DOCTYPE pi state".
+       if ($is_space->{$self->{nc}} or
+           $self->{nc} == 0x003F or # ?
+           $self->{nc} == -1) {
+         ## XML5: U+003F: "pi state": Same as "Anything else"; "DOCTYPE
+         ## pi state": Switch to the "DOCTYPE pi after state".  EOF:
+         ## "DOCTYPE pi state": Parse error, switch to the "data
+         ## state".
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'bare pio', ## TODO: type
+                         line => $self->{line_prev},
+                         column => $self->{column_prev}
+                             - 1 * ($self->{nc} != -1));
+         $self->{state} = BOGUS_COMMENT_STATE;
+         ## Reconsume.
+         $self->{ct} = {type => COMMENT_TOKEN,
+                        data => '?',
+                        line => $self->{line_prev},
+                        column => $self->{column_prev}
+                            - 1 * ($self->{nc} != -1),
+                       };
+         redo A;
+       } else {
+         ## XML5: "DOCTYPE pi state": Stay in the state.
+         $self->{ct} = {type => PI_TOKEN,
+                        target => chr $self->{nc},
+                        data => '',
+                        line => $self->{line_prev},
+                        column => $self->{column_prev} - 1,
+                       };
+         $self->{state} = PI_TARGET_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       }
+     } elsif ($self->{state} == PI_TARGET_STATE) {
+       if ($is_space->{$self->{nc}}) {
+         $self->{state} = PI_TARGET_AFTER_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == -1) {
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'no pic'); ## TODO: type
+         if ($self->{in_subset}) {
+           $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+         } else {
+           $self->{state} = DATA_STATE;
+           $self->{s_kwd} = '';
+         }
+         ## Reconsume.
+         return  ($self->{ct}); # pi
+         redo A;
+       } elsif ($self->{nc} == 0x003F) { # ?
+         $self->{state} = PI_AFTER_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } else {
+         ## XML5: typo ("tag name" -> "target")
+         $self->{ct}->{target} .= chr $self->{nc}; # pi
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       }
+     } elsif ($self->{state} == PI_TARGET_AFTER_STATE) {
+       if ($is_space->{$self->{nc}}) {
+         ## Stay in the state.
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } else {
+         $self->{state} = PI_DATA_STATE;
+         ## Reprocess.
+         redo A;
+       }
+     } elsif ($self->{state} == PI_DATA_STATE) {
+       if ($self->{nc} == 0x003F) { # ?
+         $self->{state} = PI_DATA_AFTER_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == -1) {
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'no pic'); ## TODO: type
+         if ($self->{in_subset}) {
+           $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE; ## XML5: "Data state"
+         } else {
+           $self->{state} = DATA_STATE;
+           $self->{s_kwd} = '';
+         }
+         ## Reprocess.
+         return  ($self->{ct}); # pi
+         redo A;
+       } else {
+         $self->{ct}->{data} .= chr $self->{nc}; # pi
+         $self->{read_until}->($self->{ct}->{data}, q[?],
+                               length $self->{ct}->{data});
+         ## Stay in the state.
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         ## Reprocess.
+         redo A;
+       }
+     } elsif ($self->{state} == PI_AFTER_STATE) {
+       ## XML5: Part of "Pi after state".
+       if ($self->{nc} == 0x003E) { # >
+         if ($self->{in_subset}) {
+           $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+         } else {
+           $self->{state} = DATA_STATE;
+           $self->{s_kwd} = '';
+         }
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         return  ($self->{ct}); # pi
+         redo A;
+       } elsif ($self->{nc} == 0x003F) { # ?
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'no s after target', ## TODO: type
+                         line => $self->{line_prev},
+                         column => $self->{column_prev}); ## XML5: no error
+         $self->{ct}->{data} .= '?';
+         $self->{state} = PI_DATA_AFTER_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } else {
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'no s after target', ## TODO: type
+                         line => $self->{line_prev},
+                         column => $self->{column_prev}
+                             + 1 * ($self->{nc} == -1)); ## XML5: no error
+         $self->{ct}->{data} .= '?'; ## XML5: not appended
+         $self->{state} = PI_DATA_STATE;
+         ## Reprocess.
+         redo A;
+       }
+     } elsif ($self->{state} == PI_DATA_AFTER_STATE) {
+       ## XML5: Same as "pi after state" and "DOCTYPE pi after state".
+       if ($self->{nc} == 0x003E) { # >
+         if ($self->{in_subset}) {
+           $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+         } else {
+           $self->{state} = DATA_STATE;
+           $self->{s_kwd} = '';
+         }
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         return  ($self->{ct}); # pi
+         redo A;
+       } elsif ($self->{nc} == 0x003F) { # ?
+         $self->{ct}->{data} .= '?';
+         ## Stay in the state.
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } else {
+         $self->{ct}->{data} .= '?'; ## XML5: not appended
+         $self->{state} = PI_DATA_STATE;
+         ## Reprocess.
+         redo A;
+       }
+     } elsif ($self->{state} == DOCTYPE_INTERNAL_SUBSET_STATE) {
+       if ($self->{nc} == 0x003C) { # <
+         $self->{state} = DOCTYPE_TAG_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == 0x0025) { # %
+         ## XML5: Not defined yet.
+         ## TODO:
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == 0x005D) { # ]
+         delete $self->{in_subset};
+         $self->{state} = DOCTYPE_INTERNAL_SUBSET_AFTER_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($is_space->{$self->{nc}}) {
+         ## Stay in the state.
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == -1) {
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed internal subset'); ## TODO: type
+         delete $self->{in_subset};
+         $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
+         ## Reconsume.
+         return  ({type => END_OF_DOCTYPE_TOKEN});
+         redo A;
+       } else {
+         unless ($self->{internal_subset_tainted}) {
+           ## XML5: No parse error.
+           $self->{parse_error}->(level => $self->{level}->{must}, type => 'string in internal subset');
+           $self->{internal_subset_tainted} = 1;
+         }
+         ## Stay in the state.
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       }
+     } elsif ($self->{state} == DOCTYPE_INTERNAL_SUBSET_AFTER_STATE) {
+       if ($self->{nc} == 0x003E) { # >
+         $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         return  ({type => END_OF_DOCTYPE_TOKEN});
+         redo A;
+       } elsif ($self->{nc} == -1) {
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed DOCTYPE');
+         $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
+         ## Reconsume.
+         return  ({type => END_OF_DOCTYPE_TOKEN});
+         redo A;
+       } else {
+         ## XML5: No parse error and stay in the state.
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'string after internal subset'); ## TODO: type
+         $self->{state} = BOGUS_DOCTYPE_INTERNAL_SUBSET_AFTER_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       }
+     } elsif ($self->{state} == BOGUS_DOCTYPE_INTERNAL_SUBSET_AFTER_STATE) {
+       if ($self->{nc} == 0x003E) { # >
+         $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         return  ({type => END_OF_DOCTYPE_TOKEN});
+         redo A;
+       } elsif ($self->{nc} == -1) {
+         $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
+         ## Reconsume.
+         return  ({type => END_OF_DOCTYPE_TOKEN});
+         redo A;
+       } else {
+         ## Stay in the state.
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       }
+     } elsif ($self->{state} == DOCTYPE_TAG_STATE) {
+       if ($self->{nc} == 0x0021) { # !
+         $self->{state} = DOCTYPE_MARKUP_DECLARATION_OPEN_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == 0x003F) { # ?
+         $self->{state} = PI_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == -1) {
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'bare stago');
+         $self->{state} = DATA_STATE;
+         $self->{s_kwd} = '';
+         ## Reconsume.
+         redo A;
+       } else {
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'bare stago', ## XML5: Not a parse error.
+                         line => $self->{line_prev},
+                         column => $self->{column_prev});
+         $self->{state} = BOGUS_COMMENT_STATE;
+         $self->{ct} = {type => COMMENT_TOKEN,
+                        data => '',
+                       }; ## NOTE: Will be discarded.
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       }
+     } elsif ($self->{state} == DOCTYPE_MARKUP_DECLARATION_OPEN_STATE) {
+       ## XML5: "DOCTYPE markup declaration state".
+       if ($self->{nc} == 0x002D) { # -
+         $self->{state} = MD_HYPHEN_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == 0x0045 or # E
+                $self->{nc} == 0x0065) { # e
+         $self->{state} = MD_E_STATE;
+         $self->{kwd} = chr $self->{nc};
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == 0x0041 or # A
+                $self->{nc} == 0x0061) { # a
+         $self->{state} = MD_ATTLIST_STATE;
+         $self->{kwd} = chr $self->{nc};
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == 0x004E or # N
+                $self->{nc} == 0x006E) { # n
+         $self->{state} = MD_NOTATION_STATE;
+         $self->{kwd} = chr $self->{nc};
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } else {
+         #
+       }
+       ## XML5: No parse error.
+       $self->{parse_error}->(level => $self->{level}->{must}, type => 'bogus comment',
+                       line => $self->{line_prev},
+                       column => $self->{column_prev} - 1);
+       ## Reconsume.
+       $self->{state} = BOGUS_COMMENT_STATE;
+       $self->{ct} = {type => COMMENT_TOKEN, data => ''}; ## Will be discarded.
+       redo A;
+     } elsif ($self->{state} == MD_E_STATE) {
+       if ($self->{nc} == 0x004E or # N
+           $self->{nc} == 0x006E) { # n
+         $self->{state} = MD_ENTITY_STATE;
+         $self->{kwd} .= chr $self->{nc};
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == 0x004C or # L
+                $self->{nc} == 0x006C) { # l
+         ## XML5: <!ELEMENT> not supported.
+         $self->{state} = MD_ELEMENT_STATE;
+         $self->{kwd} .= chr $self->{nc};
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } else {
+         ## XML5: No parse error.
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'bogus comment',
+                         line => $self->{line_prev},
+                         column => $self->{column_prev} - 2
+                             + 1 * ($self->{nc} == -1));
+         ## Reconsume.
+         $self->{state} = BOGUS_COMMENT_STATE;
+         $self->{ct} = {type => COMMENT_TOKEN, data => ''}; ## Will be discarded
+         redo A;
+       }
+     } elsif ($self->{state} == MD_ENTITY_STATE) {
+       if ($self->{nc} == [
+             undef,
+             undef,
+x0054, # T
+x0049, # I
+x0054, # T
+           ]->[length $self->{kwd}] or
+           $self->{nc} == [
+             undef,
+             undef,
+x0074, # t
+x0069, # i
+x0074, # t
+           ]->[length $self->{kwd}]) {
+         ## Stay in the state.
+         $self->{kwd} .= chr $self->{nc};
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ((length $self->{kwd}) == 5 and
+                ($self->{nc} == 0x0059 or # Y
+                 $self->{nc} == 0x0079)) { # y
+         if ($self->{kwd} ne 'ENTIT' or $self->{nc} == 0x0079) {
+           $self->{parse_error}->(level => $self->{level}->{must}, type => 'lowercase keyword', ## TODO: type
+                           text => 'ENTITY',
+                           line => $self->{line_prev},
+                           column => $self->{column_prev} - 4);
+         }
+         $self->{ct} = {type => GENERAL_ENTITY_TOKEN, name => '',
+                        line => $self->{line_prev},
+                        column => $self->{column_prev} - 6};
+         $self->{state} = DOCTYPE_MD_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } else {
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'bogus comment',
+                         line => $self->{line_prev},
+                         column => $self->{column_prev} - 1
+                             - (length $self->{kwd})
+                             + 1 * ($self->{nc} == -1));
+         $self->{state} = BOGUS_COMMENT_STATE;
+         ## Reconsume.
+         $self->{ct} = {type => COMMENT_TOKEN, data => ''}; ## Will be discarded
+         redo A;
+       }
+     } elsif ($self->{state} == MD_ELEMENT_STATE) {
+       if ($self->{nc} == [
+            undef,
+            undef,
+x0045, # E
+x004D, # M
+x0045, # E
+x004E, # N
+           ]->[length $self->{kwd}] or
+           $self->{nc} == [
+            undef,
+            undef,
+x0065, # e
+x006D, # m
+x0065, # e
+x006E, # n
+           ]->[length $self->{kwd}]) {
+         ## Stay in the state.
+         $self->{kwd} .= chr $self->{nc};
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ((length $self->{kwd}) == 6 and
+                ($self->{nc} == 0x0054 or # T
+                 $self->{nc} == 0x0074)) { # t
+         if ($self->{kwd} ne 'ELEMEN' or $self->{nc} == 0x0074) {
+           $self->{parse_error}->(level => $self->{level}->{must}, type => 'lowercase keyword', ## TODO: type
+                           text => 'ELEMENT',
+                           line => $self->{line_prev},
+                           column => $self->{column_prev} - 5);
+         }
+         $self->{ct} = {type => ELEMENT_TOKEN, name => '',
+                        line => $self->{line_prev},
+                        column => $self->{column_prev} - 6};
+         $self->{state} = DOCTYPE_MD_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } else {
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'bogus comment',
+                         line => $self->{line_prev},
+                         column => $self->{column_prev} - 1
+                             - (length $self->{kwd})
+                             + 1 * ($self->{nc} == -1));
+         $self->{state} = BOGUS_COMMENT_STATE;
+         ## Reconsume.
+         $self->{ct} = {type => COMMENT_TOKEN, data => ''}; ## Will be discarded
+         redo A;
+       }
+     } elsif ($self->{state} == MD_ATTLIST_STATE) {
+       if ($self->{nc} == [
+            undef,
+x0054, # T
+x0054, # T
+x004C, # L
+x0049, # I
+x0053, # S
+           ]->[length $self->{kwd}] or
+           $self->{nc} == [
+            undef,
+x0074, # t
+x0074, # t
+x006C, # l
+x0069, # i
+x0073, # s
+           ]->[length $self->{kwd}]) {
+         ## Stay in the state.
+         $self->{kwd} .= chr $self->{nc};
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ((length $self->{kwd}) == 6 and
+                ($self->{nc} == 0x0054 or # T
+                 $self->{nc} == 0x0074)) { # t
+         if ($self->{kwd} ne 'ATTLIS' or $self->{nc} == 0x0074) {
+           $self->{parse_error}->(level => $self->{level}->{must}, type => 'lowercase keyword', ## TODO: type
+                           text => 'ATTLIST',
+                           line => $self->{line_prev},
+                           column => $self->{column_prev} - 5);
+         }
+         $self->{ct} = {type => ATTLIST_TOKEN, name => '',
+                        attrdefs => [],
+                        line => $self->{line_prev},
+                        column => $self->{column_prev} - 6};
+         $self->{state} = DOCTYPE_MD_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } else {
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'bogus comment',
+                         line => $self->{line_prev},
+                         column => $self->{column_prev} - 1
+                              - (length $self->{kwd})
+                              + 1 * ($self->{nc} == -1));
+         $self->{state} = BOGUS_COMMENT_STATE;
+         ## Reconsume.
+         $self->{ct} = {type => COMMENT_TOKEN, data => ''}; ## Will be discarded
+         redo A;
+       }
+     } elsif ($self->{state} == MD_NOTATION_STATE) {
+       if ($self->{nc} == [
+            undef,
+x004F, # O
+x0054, # T
+x0041, # A
+x0054, # T
+x0049, # I
+x004F, # O
+           ]->[length $self->{kwd}] or
+           $self->{nc} == [
+            undef,
+x006F, # o
+x0074, # t
+x0061, # a
+x0074, # t
+x0069, # i
+x006F, # o
+           ]->[length $self->{kwd}]) {
+         ## Stay in the state.
+         $self->{kwd} .= chr $self->{nc};
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ((length $self->{kwd}) == 7 and
+                ($self->{nc} == 0x004E or # N
+                 $self->{nc} == 0x006E)) { # n
+         if ($self->{kwd} ne 'NOTATIO' or $self->{nc} == 0x006E) {
+           $self->{parse_error}->(level => $self->{level}->{must}, type => 'lowercase keyword', ## TODO: type
+                           text => 'NOTATION',
+                           line => $self->{line_prev},
+                           column => $self->{column_prev} - 6);
+         }
+         $self->{ct} = {type => NOTATION_TOKEN, name => '',
+                        line => $self->{line_prev},
+                        column => $self->{column_prev} - 6};
+         $self->{state} = DOCTYPE_MD_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } else {
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'bogus comment',
+                         line => $self->{line_prev},
+                         column => $self->{column_prev} - 1
+                             - (length $self->{kwd})
+                             + 1 * ($self->{nc} == -1));
+         $self->{state} = BOGUS_COMMENT_STATE;
+         ## Reconsume.
+         $self->{ct} = {type => COMMENT_TOKEN, data => ''}; ## Will be discarded
+         redo A;
+       }
+     } elsif ($self->{state} == DOCTYPE_MD_STATE) {
+       ## XML5: "DOCTYPE ENTITY state", "DOCTYPE ATTLIST state", and
+       ## "DOCTYPE NOTATION state".
+       if ($is_space->{$self->{nc}}) {
+         ## XML5: [NOTATION] Switch to the "DOCTYPE NOTATION identifier state".
+         $self->{state} = BEFORE_MD_NAME_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{ct}->{type} == GENERAL_ENTITY_TOKEN and
+                $self->{nc} == 0x0025) { # %
+         ## XML5: Switch to the "DOCTYPE bogus comment state".
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'no space before md name'); ## TODO: type
+         $self->{state} = DOCTYPE_ENTITY_PARAMETER_BEFORE_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == -1) {
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed md'); ## TODO: type
+         $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE; ## XML5: "Data state".
+         ## Reconsume.
+         redo A;
+       } elsif ($self->{nc} == 0x003E) { # >
+         ## XML5: Switch to the "DOCTYPE bogus comment state".
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'no md name'); ## TODO: type
+         $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } else {
+         ## XML5: Switch to the "DOCTYPE bogus comment state".
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'no space before md name'); ## TODO: type
+         $self->{state} = BEFORE_MD_NAME_STATE;
+         redo A;
+       }
+     } elsif ($self->{state} == BEFORE_MD_NAME_STATE) {
+       ## XML5: "DOCTYPE ENTITY parameter state", "DOCTYPE ENTITY type
+       ## before state", "DOCTYPE ATTLIST name before state".
+       if ($is_space->{$self->{nc}}) {
+         ## Stay in the state.
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{ct}->{type} == GENERAL_ENTITY_TOKEN and
+                $self->{nc} == 0x0025) { # %
+         $self->{state} = DOCTYPE_ENTITY_PARAMETER_BEFORE_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == 0x003E) { # >
+         ## XML5: Same as "Anything else".
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'no md name'); ## TODO: type
+         $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == -1) {
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed md'); ## TODO: type
+         $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE; ## XML5: "Data state".
+         ## Reconsume.
+         redo A;
+       } else {
+         ## XML5: [ATTLIST] Not defined yet.
+         $self->{ct}->{name} .= chr $self->{nc};
+         $self->{state} = MD_NAME_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       }
+     } elsif ($self->{state} == DOCTYPE_ENTITY_PARAMETER_BEFORE_STATE) {
+       if ($is_space->{$self->{nc}}) {
+         ## XML5: Switch to the "DOCTYPE ENTITY parameter state".
+         $self->{ct}->{type} = PARAMETER_ENTITY_TOKEN;
+         $self->{state} = BEFORE_MD_NAME_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == 0x003E) { # >
+         ## XML5: Same as "Anything else".
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'no md name'); ## TODO: type
+         $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == -1) {
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed md');
+         $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE; ## XML5: "Data state".
+         ## Reconsume.
+         redo A;
+       } else {
+         ## XML5: No parse error.
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'no space after ENTITY percent'); ## TODO: type
+         $self->{state} = BOGUS_COMMENT_STATE;
+         $self->{ct} = {type => COMMENT_TOKEN, data => ''}; ## Will be discarded
+         ## Reconsume.
+         redo A;
+       }
+     } elsif ($self->{state} == MD_NAME_STATE) {
+       ## XML5: "DOCTYPE ENTITY name state" and "DOCTYPE ATTLIST name state".
+       if ($is_space->{$self->{nc}}) {
+         if ($self->{ct}->{type} == ATTLIST_TOKEN) {
+           $self->{state} = DOCTYPE_ATTLIST_NAME_AFTER_STATE;
+         } elsif ($self->{ct}->{type} == ELEMENT_TOKEN) {
+           ## TODO: ...
+           $self->{state} = DOCTYPE_ATTLIST_NAME_AFTER_STATE;
+         } else { # ENTITY/NOTATION
+           $self->{state} = AFTER_DOCTYPE_NAME_STATE;
+         }
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == 0x003E) { # >
+         if ($self->{ct}->{type} == ATTLIST_TOKEN) {
+           #
+         } else {
+           $self->{parse_error}->(level => $self->{level}->{must}, type => 'no md def'); ## TODO: type
+         }
+         $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         return  ($self->{ct}); # ELEMENT/ENTITY/ATTLIST/NOTATION
+         redo A;
+       } elsif ($self->{nc} == -1) {
+         ## XML5: [ATTLIST] No parse error.
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed md');
+         $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE; ## XML5: "Data state".
+         ## Reconsume.
+         return  ($self->{ct}); # ELEMENT/ENTITY/ATTLIST/NOTATION
+         redo A;
+       } else {
+         ## XML5: [ATTLIST] Not defined yet.
+         $self->{ct}->{name} .= chr $self->{nc};
+         ## Stay in the state.
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       }
+     } elsif ($self->{state} == DOCTYPE_ATTLIST_NAME_AFTER_STATE) {
+       if ($is_space->{$self->{nc}}) {
+         ## Stay in the state.
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == 0x003E) { # >
+         $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         return  ($self->{ct}); # ATTLIST
+         redo A;
+       } elsif ($self->{nc} == -1) {
+         ## XML5: No parse error.
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed md'); ## TODO: type
+         $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE; ## XML5: "Data state".
+         return  ($self->{ct});
+         redo A;
+       } else {
+         ## XML5: Not defined yet.
+         $self->{ca} = {name => chr ($self->{nc}), # attrdef
+                        tokens => [],
+                        line => $self->{line}, column => $self->{column}};
+         $self->{state} = DOCTYPE_ATTLIST_ATTRIBUTE_NAME_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       }
+     } elsif ($self->{state} == DOCTYPE_ATTLIST_ATTRIBUTE_NAME_STATE) {
+       if ($is_space->{$self->{nc}}) {
+         $self->{state} = DOCTYPE_ATTLIST_ATTRIBUTE_NAME_AFTER_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == 0x003E) { # >
+         ## XML5: Same as "anything else".
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'no attr type'); ## TODO: type
+         $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         return  ($self->{ct}); # ATTLIST
+         redo A;
+       } elsif ($self->{nc} == 0x0028) { # (
+         ## XML5: Same as "anything else".
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'no space before paren'); ## TODO: type
+         $self->{state} = BEFORE_ALLOWED_TOKEN_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == -1) {
+         ## XML5: No parse error.
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed md'); ## TODO: type
+         $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE; ## XML5: "Data state".
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         return  ($self->{ct}); # ATTLIST
+         redo A;
+       } else {
+         ## XML5: Not defined yet.
+         $self->{ca}->{name} .= chr $self->{nc};
+         ## Stay in the state.
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       }
+     } elsif ($self->{state} == DOCTYPE_ATTLIST_ATTRIBUTE_NAME_AFTER_STATE) {
+       if ($is_space->{$self->{nc}}) {
+         ## Stay in the state.
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == 0x003E) { # >
+         ## XML5: Same as "anything else".
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'no attr type'); ## TODO: type
+         $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         return  ($self->{ct}); # ATTLIST
+         redo A;
+       } elsif ($self->{nc} == 0x0028) { # (
+         ## XML5: Same as "anything else".
+         $self->{state} = BEFORE_ALLOWED_TOKEN_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == -1) {
+         ## XML5: No parse error.
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed md'); ## TODO: type
+         $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE; ## XML5: "Data state".
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         return  ($self->{ct});
+         redo A;
+       } else {
+         ## XML5: Not defined yet.
+         $self->{ca}->{type} = chr $self->{nc};
+         $self->{state} = DOCTYPE_ATTLIST_ATTRIBUTE_TYPE_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       }
+     } elsif ($self->{state} == DOCTYPE_ATTLIST_ATTRIBUTE_TYPE_STATE) {
+       if ($is_space->{$self->{nc}}) {
+         $self->{state} = DOCTYPE_ATTLIST_ATTRIBUTE_TYPE_AFTER_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == 0x0023) { # #
+         ## XML5: Same as "anything else".
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'no space before default value'); ## TODO: type
+         $self->{state} = DOCTYPE_ATTLIST_ATTRIBUTE_DECLARATION_BEFORE_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == 0x0022) { # "
+         ## XML5: Same as "anything else".
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'no space before default value'); ## TODO: type
+         $self->{ca}->{value} = '';
+         $self->{state} = ATTRIBUTE_VALUE_DOUBLE_QUOTED_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == 0x0027) { # '
+         ## XML5: Same as "anything else".
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'no space before default value'); ## TODO: type
+         $self->{ca}->{value} = '';
+         $self->{state} = ATTRIBUTE_VALUE_SINGLE_QUOTED_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == 0x003E) { # >
+         ## XML5: Same as "anything else".
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'no attr default'); ## TODO: type
+         $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         return  ($self->{ct}); # ATTLIST
+         redo A;
+       } elsif ($self->{nc} == 0x0028) { # (
+         ## XML5: Same as "anything else".
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'no space before paren'); ## TODO: type
+         $self->{state} = BEFORE_ALLOWED_TOKEN_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == -1) {
+         ## XML5: No parse error.
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed md'); ## TODO: type
+         $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE; ## XML5: "Data state".
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         return  ($self->{ct});
+         redo A;
+       } else {
+         ## XML5: Not defined yet.
+         $self->{ca}->{type} .= chr $self->{nc};
+         ## Stay in the state.
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       }
+     } elsif ($self->{state} == DOCTYPE_ATTLIST_ATTRIBUTE_TYPE_AFTER_STATE) {
+       if ($is_space->{$self->{nc}}) {
+         ## Stay in the state.
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == 0x0028) { # (
+         ## XML5: Same as "anything else".
+         $self->{state} = BEFORE_ALLOWED_TOKEN_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == 0x0023) { # #
+         $self->{state} = DOCTYPE_ATTLIST_ATTRIBUTE_DECLARATION_BEFORE_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == 0x0022) { # "
+         ## XML5: Same as "anything else".
+         $self->{ca}->{value} = '';
+         $self->{state} = ATTRIBUTE_VALUE_DOUBLE_QUOTED_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == 0x0027) { # '
+         ## XML5: Same as "anything else".
+         $self->{ca}->{value} = '';
+         $self->{state} = ATTRIBUTE_VALUE_SINGLE_QUOTED_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == 0x003E) { # >
+         ## XML5: Same as "anything else".
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'no attr default'); ## TODO: type
+         $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         return  ($self->{ct}); # ATTLIST
+         redo A;
+       } elsif ($self->{nc} == -1) {
+         ## XML5: No parse error.
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed md'); ## TODO: type
+         $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE; ## XML5: "Data state".
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         return  ($self->{ct});
+         redo A;
+       } else {
+         ## XML5: Switch to the "DOCTYPE bogus comment state".
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'unquoted attr value'); ## TODO: type
+         $self->{ca}->{value} = '';
+         $self->{state} = ATTRIBUTE_VALUE_UNQUOTED_STATE;
          ## Reconsume.
          redo A;
        }
+     } elsif ($self->{state} == BEFORE_ALLOWED_TOKEN_STATE) {
+       if ($is_space->{$self->{nc}}) {
+         ## Stay in the state.
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == 0x007C) { # |
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'empty allowed token'); ## TODO: type
+         ## Stay in the state.
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == 0x0029) { # )
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'empty allowed token'); ## TODO: type
+         $self->{state} = AFTER_ALLOWED_TOKENS_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == 0x003E) { # >
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed allowed tokens'); ## TODO: type
+         $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         return  ($self->{ct}); # ATTLIST
+         redo A;
+       } elsif ($self->{nc} == -1) {
+         ## XML5: No parse error.
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed md'); ## TODO: type
+         $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE; ## XML5: "Data state".
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         return  ($self->{ct});
+         redo A;
+       } else {
+         push @{$self->{ca}->{tokens}}, chr $self->{nc};
+         $self->{state} = ALLOWED_TOKEN_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       }
+     } elsif ($self->{state} == ALLOWED_TOKEN_STATE) {
+       if ($is_space->{$self->{nc}}) {
+         $self->{state} = AFTER_ALLOWED_TOKEN_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == 0x007C) { # |
+         $self->{state} = BEFORE_ALLOWED_TOKEN_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == 0x0029) { # )
+         $self->{state} = AFTER_ALLOWED_TOKENS_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == 0x003E) { # >
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed allowed tokens'); ## TODO: type
+         $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         return  ($self->{ct}); # ATTLIST
+         redo A;
+       } elsif ($self->{nc} == -1) {
+         ## XML5: No parse error.
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed md'); ## TODO: type
+         $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE; ## XML5: "Data state".
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         return  ($self->{ct});
+         redo A;
+       } else {
+         $self->{ca}->{tokens}->[-1] .= chr $self->{nc};
+         ## Stay in the state.
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       }
+     } elsif ($self->{state} == AFTER_ALLOWED_TOKEN_STATE) {
+       if ($is_space->{$self->{nc}}) {
+         ## Stay in the state.
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == 0x007C) { # |
+         $self->{state} = BEFORE_ALLOWED_TOKEN_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == 0x0029) { # )
+         $self->{state} = AFTER_ALLOWED_TOKENS_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == 0x003E) { # >
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed allowed tokens'); ## TODO: type
+         $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         return  ($self->{ct}); # ATTLIST
+         redo A;
+       } elsif ($self->{nc} == -1) {
+         ## XML5: No parse error.
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed md'); ## TODO: type
+         $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE; ## XML5: "Data state".
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         return  ($self->{ct});
+         redo A;
+       } else {
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'space in allowed token', ## TODO: type
+                         line => $self->{line_prev},
+                         column => $self->{column_prev});
+         $self->{ca}->{tokens}->[-1] .= ' ' . chr $self->{nc};
+         $self->{state} = ALLOWED_TOKEN_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       }
+     } elsif ($self->{state} == AFTER_ALLOWED_TOKENS_STATE) {
+       if ($is_space->{$self->{nc}}) {
+         $self->{state} = BEFORE_ATTR_DEFAULT_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == 0x0023) { # #
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'no space before default value'); ## TODO: type
+         $self->{state} = DOCTYPE_ATTLIST_ATTRIBUTE_DECLARATION_BEFORE_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == 0x0022) { # "
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'no space before default value'); ## TODO: type
+         $self->{ca}->{value} = '';
+         $self->{state} = ATTRIBUTE_VALUE_DOUBLE_QUOTED_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == 0x0027) { # '
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'no space before default value'); ## TODO: type
+         $self->{ca}->{value} = '';
+         $self->{state} = ATTRIBUTE_VALUE_SINGLE_QUOTED_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == 0x003E) { # >
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'no attr default'); ## TODO: type
+         $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         return  ($self->{ct}); # ATTLIST
+         redo A;
+       } elsif ($self->{nc} == -1) {
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed md'); ## TODO: type
+         $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         return  ($self->{ct});
+         redo A;
+       } else {
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'unquoted attr value'); ## TODO: type
+         $self->{state} = ATTRIBUTE_VALUE_UNQUOTED_STATE;
+         ## Reconsume.
+         redo A;
+       }
+     } elsif ($self->{state} == BEFORE_ATTR_DEFAULT_STATE) {
+       if ($is_space->{$self->{nc}}) {
+         ## Stay in the state.
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == 0x0023) { # #
+         $self->{state} = DOCTYPE_ATTLIST_ATTRIBUTE_DECLARATION_BEFORE_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == 0x0022) { # "
+         $self->{ca}->{value} = '';
+         $self->{state} = ATTRIBUTE_VALUE_DOUBLE_QUOTED_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == 0x0027) { # '
+         $self->{ca}->{value} = '';
+         $self->{state} = ATTRIBUTE_VALUE_SINGLE_QUOTED_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == 0x003E) { # >
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'no attr default'); ## TODO: type
+         $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         return  ($self->{ct}); # ATTLIST
+         redo A;
+       } elsif ($self->{nc} == -1) {
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed md'); ## TODO: type
+         $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         return  ($self->{ct});
+         redo A;
+       } else {
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'unquoted attr value'); ## TODO: type
+         $self->{state} = ATTRIBUTE_VALUE_UNQUOTED_STATE;
+         ## Reconsume.
+         redo A;
+       }
+     } elsif ($self->{state} == DOCTYPE_ATTLIST_ATTRIBUTE_DECLARATION_BEFORE_STATE) {
+       if ($is_space->{$self->{nc}}) {
+         ## XML5: No parse error.
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'no default type'); ## TODO: type
+         $self->{state} = BOGUS_MD_STATE;
+         ## Reconsume.
+         redo A;
+       } elsif ($self->{nc} == 0x0022) { # "
+         ## XML5: Same as "anything else".
+         $self->{ca}->{value} = '';
+         $self->{state} = ATTRIBUTE_VALUE_DOUBLE_QUOTED_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == 0x0027) { # '
+         ## XML5: Same as "anything else".
+         $self->{ca}->{value} = '';
+         $self->{state} = ATTRIBUTE_VALUE_SINGLE_QUOTED_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == 0x003E) { # >
+         ## XML5: Same as "anything else".
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'no attr default'); ## TODO: type
+         $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         return  ($self->{ct}); # ATTLIST
+         redo A;
+       } elsif ($self->{nc} == -1) {
+         ## XML5: No parse error.
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed md'); ## TODO: type
+         $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE; ## XML5: "Data state".
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         return  ($self->{ct});
+         redo A;
+       } else {
+         $self->{ca}->{default} = chr $self->{nc};
+         $self->{state} = DOCTYPE_ATTLIST_ATTRIBUTE_DECLARATION_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       }
+     } elsif ($self->{state} == DOCTYPE_ATTLIST_ATTRIBUTE_DECLARATION_STATE) {
+       if ($is_space->{$self->{nc}}) {
+         $self->{state} = DOCTYPE_ATTLIST_ATTRIBUTE_DECLARATION_AFTER_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == 0x0022) { # "
+         ## XML5: Same as "anything else".
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'no space before default value'); ## TODO: type
+         $self->{ca}->{value} = '';
+         $self->{state} = ATTRIBUTE_VALUE_DOUBLE_QUOTED_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == 0x0027) { # '
+         ## XML5: Same as "anything else".
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'no space before default value'); ## TODO: type
+         $self->{ca}->{value} = '';
+         $self->{state} = ATTRIBUTE_VALUE_SINGLE_QUOTED_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == 0x003E) { # >
+         ## XML5: Same as "anything else".
+         push @{$self->{ct}->{attrdefs}}, $self->{ca};
+         $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         return  ($self->{ct}); # ATTLIST
+         redo A;
+       } elsif ($self->{nc} == -1) {
+         ## XML5: No parse error.
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed md'); ## TODO: type
+         push @{$self->{ct}->{attrdefs}}, $self->{ca};
+         $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE; ## XML5: "Data state".
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         return  ($self->{ct});
+         redo A;
+       } else {
+         $self->{ca}->{default} .= chr $self->{nc};
+         ## Stay in the state.
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       }
+     } elsif ($self->{state} == DOCTYPE_ATTLIST_ATTRIBUTE_DECLARATION_AFTER_STATE) {
+       if ($is_space->{$self->{nc}}) {
+         ## Stay in the state.
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == 0x0022) { # "
+         $self->{ca}->{value} = '';
+         $self->{state} = ATTRIBUTE_VALUE_DOUBLE_QUOTED_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == 0x0027) { # '
+         $self->{ca}->{value} = '';
+         $self->{state} = ATTRIBUTE_VALUE_SINGLE_QUOTED_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       } elsif ($self->{nc} == 0x003E) { # >
+         push @{$self->{ct}->{attrdefs}}, $self->{ca};
+         $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         return  ($self->{ct}); # ATTLIST
+         redo A;
+       } elsif ($self->{nc} == -1) {
+         ## XML5: No parse error.
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'unclosed md'); ## TODO: type
+         push @{$self->{ct}->{attrdefs}}, $self->{ca};
+         $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE; ## XML5: "Data state".
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         return  ($self->{ct});
+         redo A;
+       } else {
+         ## XML5: Not defined yet.
+         if ($self->{ca}->{default} eq 'FIXED') {
+           $self->{state} = ATTRIBUTE_VALUE_UNQUOTED_STATE;
+         } else {
+           push @{$self->{ct}->{attrdefs}}, $self->{ca};
+           $self->{state} = DOCTYPE_ATTLIST_NAME_AFTER_STATE;
+         }
+         ## Reconsume.
+         redo A;
+       }
+     } elsif ($self->{state} == AFTER_ATTLIST_ATTR_VALUE_QUOTED_STATE) {
+       if ($is_space->{$self->{nc}} or
+           $self->{nc} == -1 or
+           $self->{nc} == 0x003E) { # >
+         $self->{state} = DOCTYPE_ATTLIST_NAME_AFTER_STATE;
+         ## Reconsume.
+         redo A;
+       } else {
+         $self->{parse_error}->(level => $self->{level}->{must}, type => 'no space before attr name'); ## TODO: type
+         $self->{state} = DOCTYPE_ATTLIST_NAME_AFTER_STATE;
+         ## Reconsume.
+         redo A;
+       }
+     } elsif ($self->{state} == BOGUS_MD_STATE) {
+       if ($self->{nc} == 0x003E) { # >
+         $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         return  ($self->{ct}); # ATTLIST/ENTITY/NOTATION
+         redo A;
+       } elsif ($self->{nc} == -1) {
+         $self->{state} = DOCTYPE_INTERNAL_SUBSET_STATE;
+         ## Reconsume.
+         return  ($self->{ct}); # ATTLIST/ENTITY/NOTATION
+         redo A;
+       } else {
+         ## Stay in the state.
+     if ($self->{char_buffer_pos} < length $self->{char_buffer}) {
+       $self->{line_prev} = $self->{line};
+       $self->{column_prev} = $self->{column};
+       $self->{column}++;
+       $self->{nc}
+           = ord substr ($self->{char_buffer}, $self->{char_buffer_pos}++, 1);
+     } else {
+       $self->{set_nc}->($self);
+     }
+         redo A;
+       }
      } else {
        die "$0: $self->{state}: Unknown state";
      }
-Line 4152 
 sub _get_next_token ($) {
+Line 7389 
 sub _get_next_token ($) {
 ;
  ## $Date$

 Legend:



Removed from v.1.4
 


changed lines


 
Added in v.1.17
 Legend:



Removed from v.1.4
 


changed lines


 
Added in v.1.17
-Removed from v.1.4
+Added in v.1.17

admin@suikawiki.org	ViewVC Help
Powered by ViewVC 1.1.24