| ... | @@ -87,6 +87,19 @@ | ... | @@ -87,6 +87,19 @@ |
| 87 | case DIGIT: \ | 87 | case DIGIT: \ |
| 88 | case '_' | 88 | case '_' |
| 89 | | 89 | |
| | 90 | enum TokenizeState { |
| | 91 | TokenizeStateStart, |
| | 92 | TokenizeStateSymbol, |
| | 93 | TokenizeStateNumber, |
| | 94 | TokenizeStateString, |
| | 95 | TokenizeStateSawDash, |
| | 96 | TokenizeStateSawSlash, |
| | 97 | TokenizeStateLineComment, |
| | 98 | TokenizeStateMultiLineComment, |
| | 99 | TokenizeStateMultiLineCommentSlash, |
| | 100 | TokenizeStateMultiLineCommentStar, |
| | 101 | }; |
| | 102 | |
| 90 | | 103 | |
| 91 | struct Tokenize { | 104 | struct Tokenize { |
| 92 | Buf *buf; | 105 | Buf *buf; |
| ... | @@ -96,6 +109,7 @@ struct Tokenize { | ... | @@ -96,6 +109,7 @@ struct Tokenize { |
| 96 | int line; | 109 | int line; |
| 97 | int column; | 110 | int column; |
| 98 | Token *cur_tok; | 111 | Token *cur_tok; |
| | 112 | int multi_line_comment_count; |
| 99 | }; | 113 | }; |
| 100 | | 114 | |
| 101 | __attribute__ ((format (printf, 2, 3))) | 115 | __attribute__ ((format (printf, 2, 3))) |
| ... | @@ -222,8 +236,78 @@ ZigList<Token> *tokenize(Buf *buf) { | ... | @@ -222,8 +236,78 @@ ZigList<Token> *tokenize(Buf *buf) { |
| 222 | begin_token(&t, TokenIdNumberSign); | 236 | begin_token(&t, TokenIdNumberSign); |
| 223 | end_token(&t); | 237 | end_token(&t); |
| 224 | break; | 238 | break; |
| | 239 | case '/': |
| | 240 | t.state = TokenizeStateSawSlash; |
| | 241 | break; |
| | 242 | default: |
| | 243 | tokenize_error(&t, "invalid character: '%c'", c); |
| | 244 | } |
| | 245 | break; |
| | 246 | case TokenizeStateSawSlash: |
| | 247 | switch (c) { |
| | 248 | case '/': |
| | 249 | t.state = TokenizeStateLineComment; |
| | 250 | break; |
| | 251 | case '*': |
| | 252 | t.state = TokenizeStateMultiLineComment; |
| | 253 | t.multi_line_comment_count = 1; |
| | 254 | break; |
| 225 | default: | 255 | default: |
| 226 | tokenize_error(&t, "invalid character: '%c'", c); | 256 | tokenize_error(&t, "invalid character: '%c'", c); |
| | 257 | break; |
| | 258 | } |
| | 259 | break; |
| | 260 | case TokenizeStateLineComment: |
| | 261 | switch (c) { |
| | 262 | case '\n': |
| | 263 | t.state = TokenizeStateStart; |
| | 264 | break; |
| | 265 | default: |
| | 266 | // do nothing |
| | 267 | break; |
| | 268 | } |
| | 269 | break; |
| | 270 | case TokenizeStateMultiLineComment: |
| | 271 | switch (c) { |
| | 272 | case '*': |
| | 273 | t.state = TokenizeStateMultiLineCommentStar; |
| | 274 | break; |
| | 275 | case '/': |
| | 276 | t.state = TokenizeStateMultiLineCommentSlash; |
| | 277 | break; |
| | 278 | default: |
| | 279 | // do nothing |
| | 280 | break; |
| | 281 | } |
| | 282 | break; |
| | 283 | case TokenizeStateMultiLineCommentSlash: |
| | 284 | switch (c) { |
| | 285 | case '*': |
| | 286 | t.state = TokenizeStateMultiLineComment; |
| | 287 | t.multi_line_comment_count += 1; |
| | 288 | break; |
| | 289 | case '/': |
| | 290 | break; |
| | 291 | default: |
| | 292 | t.state = TokenizeStateMultiLineComment; |
| | 293 | break; |
| | 294 | } |
| | 295 | break; |
| | 296 | case TokenizeStateMultiLineCommentStar: |
| | 297 | switch (c) { |
| | 298 | case '/': |
| | 299 | t.multi_line_comment_count -= 1; |
| | 300 | if (t.multi_line_comment_count == 0) { |
| | 301 | t.state = TokenizeStateStart; |
| | 302 | } else { |
| | 303 | t.state = TokenizeStateMultiLineComment; |
| | 304 | } |
| | 305 | break; |
| | 306 | case '*': |
| | 307 | break; |
| | 308 | default: |
| | 309 | t.state = TokenizeStateMultiLineComment; |
| | 310 | break; |
| 227 | } | 311 | } |
| 228 | break; | 312 | break; |
| 229 | case TokenizeStateSymbol: | 313 | case TokenizeStateSymbol: |
| ... | @@ -295,7 +379,18 @@ ZigList<Token> *tokenize(Buf *buf) { | ... | @@ -295,7 +379,18 @@ ZigList<Token> *tokenize(Buf *buf) { |
| 295 | case TokenizeStateSawDash: | 379 | case TokenizeStateSawDash: |
| 296 | end_token(&t); | 380 | end_token(&t); |
| 297 | break; | 381 | break; |
| | 382 | case TokenizeStateSawSlash: |
| | 383 | tokenize_error(&t, "unexpected EOF"); |
| | 384 | break; |
| | 385 | case TokenizeStateLineComment: |
| | 386 | break; |
| | 387 | case TokenizeStateMultiLineComment: |
| | 388 | case TokenizeStateMultiLineCommentSlash: |
| | 389 | case TokenizeStateMultiLineCommentStar: |
| | 390 | tokenize_error(&t, "unterminated multi-line comment"); |
| | 391 | break; |
| 298 | } | 392 | } |
| | 393 | t.pos = -1; |
| 299 | begin_token(&t, TokenIdEof); | 394 | begin_token(&t, TokenIdEof); |
| 300 | end_token(&t); | 395 | end_token(&t); |
| 301 | assert(!t.cur_tok); | 396 | assert(!t.cur_tok); |
| ... | @@ -333,9 +428,11 @@ static const char * token_name(Token *token) { | ... | @@ -333,9 +428,11 @@ static const char * token_name(Token *token) { |
| 333 | void print_tokens(Buf *buf, ZigList<Token> *tokens) { | 428 | void print_tokens(Buf *buf, ZigList<Token> *tokens) { |
| 334 | for (int i = 0; i < tokens->length; i += 1) { | 429 | for (int i = 0; i < tokens->length; i += 1) { |
| 335 | Token *token = &tokens->at(i); | 430 | Token *token = &tokens->at(i); |
| 336 | printf("%s ", token_name(token)); | 431 | fprintf(stderr, "%s ", token_name(token)); |
| 337 | fwrite(buf_ptr(buf) + token->start_pos, 1, token->end_pos - token->start_pos, stdout); | 432 | if (token->start_pos >= 0) { |
| 338 | printf("\n"); | 433 | fwrite(buf_ptr(buf) + token->start_pos, 1, token->end_pos - token->start_pos, stderr); |
| | 434 | } |
| | 435 | fprintf(stderr, "\n"); |
| 339 | } | 436 | } |
| 340 | } | 437 | } |
| 341 | | 438 | |